深挖MingLi-Bench数据集:160道全球算命师大赛真题的标注与分类方法

发布时间:2026/10/4 1:55:14
深挖MingLi-Bench数据集:160道全球算命师大赛真题的标注与分类方法
深挖MingLi-Bench数据集160道全球算命师大赛真题的标注与分类方法【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench是一个面向大语言模型LLM的中国传统命理评测基准覆盖八字与紫微斗数两大流派。它的核心是一份精心整理的160 道选择题数据集全部来自 2022–2025 年度「全球算命师大赛」的真实赛题。本文带你从原始命例到结构化 JSON完整拆解这套算命评测数据集的标注流程与分类方法 一、为什么用算命真题考大模型命理推演是一种开放域的传统知识推理模型需要理解干支历法、排盘规则再对人生事件做因果推断。这类任务有三个评测难点答案可验证比赛赛题自带标准答案可以精确匹配打分知识密度高一道题背后是完整的命盘推理链难度有保证题目由专业命理师命题并经过实战检验。因此MingLi-Bench 选择真题 选择题 精确匹配的组合160 道题目每题 4 个选项答对得分答错不得分简单直接结果可比性强。二、数据来源4 年的原始赛题档案 数据集的原始材料存放在 data/raw/ 目录按比赛年份拆分为 4 个纯文本文件原始文件内容行数data/raw/2022.txt2022 年赛题282data/raw/2023.txt2023 年赛题276data/raw/2024.txt2024 年赛题271data/raw/2025.txt2025 年赛题254打开任意一个文件你会看到典型的命例 多题结构例如 data/raw/2022.txt 的开篇第一例 男命1974年4月28日下午4:40分 出生地点美国 命题提供者 中国香港 方荣老师Q1 此命1996年发生何事 A 患上严重抑郁痴正确答案 B 回港认识现任妻子 ……注意两个关键信息每个例case提供一份生辰信息同一例下挂着多道选择题正确答案则以「正确答案」等标记直接写在选项后面。这是后续标注的原始依据。三、标注方法从文本到结构化 JSON ✍️3.1 拆分粒度一题一记录标注时把一个命例 × 一道题拆成一条独立记录。最终 32 个命例展开为160 道题目ftb_0001~ftb_0160每题的字段结构定义在 mingli_bench/data/schema.py字段含义示例id全局唯一编号ftb_0001question_number连续题号1–1601case_id所属命例索引case_1birth_info结构化生辰信息见下表question题干此命1996年发生何事options选项列表A–D4 个选项answer标准答案字母Acategory类别标签健康其中birth_info是最体现标注功力的一环——原始文本男命1974年4月28日下午4:40分 出生地点usa被解析成结构化字段字段值gender男year/month/day1974 / 4 / 28hour/minute16 / 4024 小时制calendar_typesolar公历locationusa160 道题共涉及32 个命例男女比例接近均衡男 81 题 / 女 79 题全部为公历solar生辰。3.2 标注结果的落盘文件整理后的标准数据集是 data/data.json这是整个项目唯一的标准答案源。所有题目均经过字段校验必填项、选项数量 ≥ 2、答案必须落在 A–H 内校验逻辑见 mingli_bench/data/loader.py。四、分类方法关键词驱动的 12 大类 ️160 道题按人生事件维度划分为12 个类别分类依据是 mingli_bench/data/schema.py 中预定义的关键词表QUESTION_CATEGORIES每个类别维护一组关键词题干/选项命中即归类未命中的落入兜底类别。部分关键词映射示例类别关键词节选事业事业、工作、升职、生意婚姻结婚、婚姻、离异、夫妻、感情财运得财、赚了、负债、存款、投资学业学历、毕业、升学、留学、考试健康疾病、身体、手术、生病、过世家庭父母、兄弟姐妹、子女、家人实际的数据分布并不均匀呈明显的生活事件热区类别题数类别题数婚姻44学业11事业25子女6家庭22外貌3健康17运势 / 灾劫各 2性格14官非1财运13 这种分布本身就是一条研究线索婚姻、事业、家庭是算命咨询的绝对主场模型在这几类上的表现最能代表其命理推理水平。评测时可以用--categories 事业 婚姻参数单独抽取特定类别做细分分析。五、数据设计细节年份推断与防偏差机制 5.1 年份如何标注数据集没有为每道题冗余存储年份而是利用每年 40 题 连续编号的规律动态推断benchmark_year 2022 (question_number - 1) // 40即题号 1–40 → 202241–80 → 2023依此类推见 mingli_bench/data/loader.py 的infer_benchmark_year。这样 data/raw/ 的年份文件与标准数据天然对齐也能在数据不一致时给出精准报错。5.2 三个防止刷分的设计选项乱序--shuffle-options会基于题号做无固定点洗牌任何选项都不留在原位并同步更新答案字母防止模型靠位置偏差蒙对答案格式归一模型回复可能千奇百怪mingli_bench/data/schema.py 内置了 10 条正则ANSWER_PATTERNS覆盖答案X、选X、单独字母等常见输出格式保证评分稳定原始答案标记ANSWER_MARKERS定义了「正确答案」「※」等原始文本中的标注符号是人工标注阶段的识别锚点。六、排盘与推理解耦预计算命盘 这是整个数据集中最巧妙的一环。命理题的解题链是生辰 → 排盘 → 推理如果模型连排盘都不会分数就失真了。为此项目用 iztro 排盘库预先为 32 个命例算好了完整八字与紫微斗数命盘存储在 data/fortune_api_results.json32 条记录全部status: success按case_id与题目关联。以case_1为例预计算结果包含八字四柱甲寅 戊辰 己亥 壬申申时紫微十二宫位、主星/辅星/杂星及亮度庙、旺、陷等完整盘面。评测时开启--astro这些命盘会直接注入提示词模型只需专注看图推理。这样得到的分数反映的是纯推理能力而非历法换算能力——正是数据集设计者想要的测量对象。这种分层量化的思路同样适用于评测解读命理推理天然缺乏自动验证机制把不确定性拆到工具层排盘→ 单流派推理 → 跨流派综合三个阶段才能准确定位模型短板。七、30 秒上手查看数据集全貌 ⚡不需要配置任何 API 密钥安装依赖后即可自查数据pip install -r requirements.txt python -m mingli_bench.cli --stats该命令会打印总题数、类别分布、缺失答案数、选项异常数等统计信息还支持--year 2025只看某一年。若想快速冒烟测试评测流程可以再加--sample 5只跑前 5 题。总结 回看 MingLi-Bench 的数据集工程几个做法值得借鉴真题来源可信160 道题目全部出自全球算命师大赛 2022–2025 四届赛题附原始档案可溯源标注可复现生辰信息结构化、字段校验规则明确、年份靠编号规律推断整套流程逻辑透明分类体系实用12 类人生事件 关键词映射既方便细分分析也贴合真实咨询场景排盘与解耦预计算命盘让评测只考推理这一件事分数更纯净。对于想研究LLM 能否看懂命理的研究者这份 data/data.json 就是一个开箱即用的评测起点 【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考