1 相关研究基础
表1 主流评测基准特征对比Table 1 Comparison of characteristics of mainstream evaluation benchmarks |
| 基准名称Benchmark name | 领域Field | 题型Question type | 语言Language | 评测方式Evaluation method |
|---|---|---|---|---|
| MMLU | 通用57科 | 选择题 | 英文 | 准确率 |
| C-Eval | 通用52科 | 选择题 | 中文 | 准确率 |
| MedQA | 医学 | 选择题 | 英/中 | 准确率 |
| LawBench | 法律 | 混合 | 中文 | 准确率/F1/ROUGE-L/回归距离等 |
| AGIEval | 综合考试 | 选择+填空 | 中/英 | 准确率/Exact Match |
| GBNP-2026(本文) | 遗传、育种、营养、生产 | 简答+论述 | 中文 | LLM评分 |
| |
|
2 评测方法与实现
2.1 题库构建与标注体系
2.2 待测模型选择与推理设置
表2 待测模型规格一览Table 2 Specification overview of the test model |
| 模型Model | 厂商Manufacturer | 类型Type | 上下文长度Sequence length | 特点Features |
|---|---|---|---|---|
| GPT-5.2 | OpenAI | 闭源 | ~128 K | 综合能力最强 |
| Kimi-2.5 | Moonshot | 开源 | ~256 K | 中文长文本优化 |
| Gemini-3 Pro | 闭源 | ~1 M | 多模态原生支持 | |
| Claude Sonnet-4.5 | Anthropic | 闭源 | ~200 K | 安全对齐优秀 |
| GLM-4.7 | 智谱AI | 闭源 | ~128 K | 中文理解优化 |
| DeepSeek-Reasoner(R1) | DeepSeek | 开源 | ~128 K | 推理链增强 |
| Grok-4 | xAI | 闭源 | ~131 K | 实时信息检索 |
| Qwen-Max | 阿里巴巴 | 开源 | ~256 K | 多语言支持 |
| Qwen3-32B | 阿里巴巴 | 开源 | ~128 K | 开源标杆 |
2.3 基于大模型的自动评分机制
2.4 低分样本错误类型的规则归类
3 实验结果
3.1 题库概况
3.2 模型总体对比
3.3 题型敏感性
3.4 知识领域一致性与“偏科”
3.5 给分点覆盖分析
3.6 错误类型深度分析
表3 各模型主导错误类型Table 3 Dominant error types of each model |
| 错误类型 Error type | 定义 Definition | 遗传Genetics (n=168)/% | 营养Nutrition (n=187)/% | 生产Production (n=152)/% | 育种Breeding (n=121)/% | χ² | P值P-value |
|---|---|---|---|---|---|---|---|
| 知识遗漏Missing knowledge | 模型未涉及题目核心要点,知识库中缺乏相关内容 | 31.50 | 35.80 | 38.20 | 47.10 | 8.42 | 0.038 |
| 幻觉编造Hallucination | 模型生成了事实性错误内容,如捏造概念或数据 | 29.20 | 23.50 | 25.70 | 21.50 | 3.21 | 0.361 |
| 答非所问Irrelevant response | 模型回答了与题目无关内容,常见于术语歧义 | 19.60 | 17.60 | 14.50 | 12.40 | 4.15 | 0.246 |
| 逻辑错误Logical error | 模型推理步骤或因果关系出现错误 | 10.10 | 11.80 | 13.80 | 16.50 | 3.87 | 0.275 |
| 表述模糊Ambiguous statement | 模型回答不够深入,仅提到关键词未展开 | 7.10 | 8.60 | 5.30 | 2.50 | 6.23 | 0.101 |
| 其他Others | 无法明确归类的错误 | 2.40 | 2.70 | 2.60 | 0.00 | - | - |
表4 各错误类型典型案例汇编Table 4 Compilation of typical cases of each error type |
| 错误类型Error type | 问题示例 Example problem | 模型错误回答摘要 Summary of the model's erroneous answers | 标准答案要点 Key points of the standard answer | 失分原因 Reasons for point loss |
|---|---|---|---|---|
| 知识遗漏 Missing Knowledge | 简述BLUP育种值估计的基本原理 | 仅提到“最佳线性无偏预测”名词 | Henderson混合模型方程、亲缘矩阵、固定效应与随机效应分离 | 缺乏数量遗传学深度知识 |
| 什么是基因组选择(GS)中的参考群体? | 回答了GWAS的参考群体概念 | 具有表型和基因型数据的个体集合、用于训练预测模型 | 混淆GS与GWAS概念 | |
| 列举3种常用的禽类DNA分子标记 | SSR、AFLP、SNP | 还应包括微卫星标记、RFLP、STR等传统标记 | 只答新型标记,遗漏经典标记 | |
| 幻觉编造Hallucination | 猪的主要经济性状遗传力范围 | “产仔数遗传力0.6~0.8” | 产仔数遗传力约0.1~0.15,属于低遗传力性状 | 严重高估,与教科书相悖 |
| 什么是杂种优势的分子机制? | “杂种优势主要由显性效应导致” | 显性假说、超显性假说、上位性假说,机制尚无定论 | 将假说当作定论 | |
| 简述鸡的性别决定机制 | “与哺乳动物相同,雄性为XY” | 鸡为ZW型,雌性为异配ZW,雄性为同配ZZ | 基础知识错误 | |
| 答非所问 Irrelevant response | 解释遗传漂变对小群体的影响 | 详细论述了自然选择的作用 | 等位基因频率随机波动、纯合度增加、遗传多样性丧失 | 完全偏题 |
| 什么是近交系数? | 回答了亲缘系数的定义 | 个体2个等位基因来自共同祖先的概率 | 混淆F与R |



