前沿技术

GBNP-2026:面向畜禽遗传、育种、营养与生产的大语言模型专业问答能力评测基准

  • 肖成朋 , 1, 2 ,
  • 李成林 1, 3 ,
  • 雷艳茹 1, 2 ,
  • 蔡钊 1, 2 ,
  • 谢伯斐 1, 2 ,
  • 王克君 1, 2 ,
  • 郭玉洁 1, 2 ,
  • 宫玉杰 1, 2 ,
  • 李东华 1, 2 ,
  • 金炜炜 1, 2 ,
  • 孙桂荣 1, 2 ,
  • 罗艳 3 ,
  • 顾兴健 3 ,
  • 陆明洲 3 ,
  • 康相涛 1, 2 ,
  • 李文婷 , 1, 2
展开
  • 1. 河南农业大学动物科技学院,河南 郑州 450046
  • 2. 神农种业实验室,河南 郑州 450046
  • 3. 南京农业大学人工智能学院,江苏 南京 210000
李文婷(1989—)女,黑龙江鹤岗人,研究方向:家禽遗传育种与繁殖,E-mail:

肖成朋(1999—)男,河南驻马店人,研究方向:家禽遗传育种与繁殖,E-mail:

收稿日期: 2026-02-27

  网络出版日期: 2026-07-18

基金资助

国家自然科学基金(32422081)

中原英才计划(育才系列):青年拔尖人才

GBNP-2026: A benchmark for evaluating large language models' professional question-answering capabilities in animal genetics, breeding, nutrition, and production

  • Chengpeng Xiao , 1, 2 ,
  • Chenglin Li 1, 3 ,
  • Yanru Lei 1, 2 ,
  • Zhao Cai 1, 2 ,
  • Bofei Xie 1, 2 ,
  • Kejun Wang 1, 2 ,
  • Yujie Guo 1, 2 ,
  • Yujie Gong 1, 2 ,
  • Donghua Li 1, 2 ,
  • Weiwei Jin 1, 2 ,
  • Guirong Sun 1, 2 ,
  • Yan Luo 3 ,
  • Xinjian Gu 3 ,
  • Mingzhou Lu 3 ,
  • Xiangtao Kang 1, 2 ,
  • Wenting Li , 1, 2
Expand
  • 1. College of Animal Science and Technology, Henan Agricultural University, Zhengzhou, 450046, Henan
  • 2. The Shennong Laboratory, Zhengzhou, 450046, Henan
  • 3. College of Artificial Intelligence, Nanjing Agricultural University, Nanjing, 210000, Jiangsu

Received date: 2026-02-27

  Online published: 2026-07-18

摘要

目的 畜禽领域问答往往术语密集、推理链条长,且常涉及指标、参数与方案的权衡;本文从主观题作答与评分细则出发,考查大语言模型在畜禽领域场景中的专业可用性。 方法 构建中文垂直测评基准,即畜禽遗传、育种、营养与生产测评基准(Genetics,breeding,nutrition,and production benchmark,GBNP-2026),收录主观题510道(简答363道、论述147道);每题配有标准答案、可核查给分点与领域标签。在零样本、无上下文条件下,对9个开源与闭源模型统一评测,采用“给分点覆盖率+质量分”双维度自动评分,并对低分样本作错误归因与跨领域比较。 结果 模型总体得分呈梯度分布,平均分64.03~83.99,覆盖率70.6%~91.9%;论述题得分整体高于简答题;育种领域在多数模型中得分最低。低分样本628例中,知识遗漏占37.3%,幻觉编造占25.0%;知识遗漏比例在领域间差异显著(χ²=8.42,P=0.038)。 结论 与单纯依赖选择题准确率相比,融合覆盖率与质量分的主观题评测有助于区分模型在畜禽专业场景中的能力差异与薄弱环节,但对严格数值推导类任务仍需另行设计题型加以验证。

本文引用格式

肖成朋 , 李成林 , 雷艳茹 , 蔡钊 , 谢伯斐 , 王克君 , 郭玉洁 , 宫玉杰 , 李东华 , 金炜炜 , 孙桂荣 , 罗艳 , 顾兴健 , 陆明洲 , 康相涛 , 李文婷 . GBNP-2026:面向畜禽遗传、育种、营养与生产的大语言模型专业问答能力评测基准[J]. 中国畜禽种业, 2026 , 22(7) : 17 -27 . DOI: 10.19543/j.cnki.1673-4556.20260507.001

Abstract

Objective Livestock-related QA is terminology-heavy and often involves indicators, parameters, and trade-offs in breeding and production plans. This study evaluates LLM professional usability using subjective responses and explicit scoring rubrics. Methods We built a Chinese vertical benchmark, the Genetics, Breeding, Nutrition, and Production Benchmark (GBNP-2026), with 510 subjective items (363 short-answer and 147 essay) spanning the same four domains, each with a reference answer, checkable scoring points, and domain tags. Nine open- and closed-source models were tested under a unified zero-shot, context-free protocol, scored by coverage and quality, followed by error attribution on low-score cases. Results Mean scores ranged from 64.03 to 83.99 and coverage from 70.6% to 91.9%. Essay items scored higher than short-answer items on average; breeding was the weakest domain for most models. Among 628 low-score samples, missing knowledge (37.3%) and hallucinations (25.0%) dominated. Missing-knowledge rates differed across domains (χ²=8.42, P = 0.038), highest in breeding (47.1%). Conclusion Compared with multiple-choice accuracy alone, coverage-plus-quality scoring helps separate capability gaps in this setting; strictly numerical or proof-style tasks still need a dedicated sub-benchmark. GBNP-2026 and the pipeline support reproducible comparison, error diagnosis, and data planning for SFT/RAG.

自从ChatGPT发布以来,大语言模型(Large language model,LLM)展现出的通用语言理解与生成能力令人惊叹[1-3]。但当模型想要应用到医疗、法律、农业等高壁垒的垂直领域上,模型的“幻觉”问题(Hallucination)和专业知识匮乏是阻碍其真正落地的瓶颈问题[4-9]。特别是在畜禽领域,包含复杂的数量遗传学公式推导、育种方案设计和营养代谢路径分析等,表述术语多、链条长,有时还要交代指标含义或参数数量级,对模型的知识组织与叙述完整性要求较高,这对模型的逻辑推理深度与专业知识广度提出了多重挑战[10]
现有的通用大模型评测基准大规模多任务语言理解(Massive multitask language understanding,MMLU)和中国基础模型评测基准(Chinese evaluation,C-Eval),虽然包含了部分生物学题目,但局限于基础概念辨析,缺乏如“如何制定鸡场鸡白痢的净化方案”或者“如何设计基于加性遗传方差的选择指数”等针对生产实践场景的复杂问答测试[10-17]
因此,本文构建畜禽遗传、育种、营养与生产主观题评测基准GBNP-2026:以专家级主观题为核心,配套标准答案、给分点与领域标签,四领域题量与难度力求均衡;并采用大语言模型裁判(Large language model as a judge,LLM-as-a-Judge),将“给分点覆盖率”与“质量分”分开刻画,在可批量复现的前提下贴近领域评分习惯。进一步地,结合低分样本的错误归因与分层统计,为模型选型及后续监督微调(Supervised fine-tuning,SFT)、检索增强生成(Retrieval-augmented generation,RAG)数据建设提供可对照的诊断信息。

1 相关研究基础

随着LLM的快速发展,评测基准经历了从单一任务到综合能力的演变。MMLU[11]和C-Eval[12]是目前最具代表性的综合性基准,涵盖了人文社科等数十个学科(表1)。然而,这些评测基本以四选一的客观题为主要考察内容,主要检验模型的知识记忆和简单推理的能力。但是对于需要长文本生成、步骤拆解的复杂场景问题,依靠准确率指标难以反映模型的真正落地能力。
表1 主流评测基准特征对比

Table 1 Comparison of characteristics of mainstream evaluation benchmarks

基准名称Benchmark name 领域Field 题型Question type 语言Language 评测方式Evaluation method
MMLU 通用57科 选择题 英文 准确率
C-Eval 通用52科 选择题 中文 准确率
MedQA 医学 选择题 英/中 准确率
LawBench 法律 混合 中文 准确率/F1/ROUGE-L/回归距离等
AGIEval 综合考试 选择+填空 中/英 准确率/Exact Match
GBNP-2026(本文) 遗传、育种、营养、生产 简答+论述 中文 LLM评分

注:现有的评测基准以客观题(选择题、填空题)为主,评测指标为简单的准确率统计。本文的GBNP-2026是首个针对畜牧育种领域的主观题评测基准,填补了农业人工智能评测的空白。

Note: The existing evaluation benchmarks mainly consist of objective questions (multiple-choice and fill-in-the-blank questions), and the evaluation metrics are simple accuracy statistics. The GBNP-2026 proposed in this paper is the first subjective question evaluation benchmark for the field of livestock breeding, filling the gap in agricultural AI evaluation.

进一步而言,在遗传育种这种集“计算-解释-决策”于一体的专业场景中,往往要求给出推导依据、关键要素与可执行流程(如育种方案设计、指标权重优化),而通用基准的客观题形式难以检验,如模型回答是否完全覆盖问题关键点、解释的内容是否自洽、是否出现看似合理但不可核查的表述。因此,通用基准的得分并不能直接映射到垂直领域的实际应用。
为了降低通用基准在领域覆盖与任务形态上的不足,出现了医疗问答基准(Medical question answering,MedQA)[4]、法律基准(Law benchmark,LawBench)[5]等垂直评测基准。已有研究表明:通用大模型在专业术语理解、关键要素覆盖以及面向实践的决策建议上容易出现偏差,通常需要基于SFT/RLHF[15-16,18-22]或RAG[23-27]才能提升性能稳定性。
在评测方法上,针对简答题与论述题,人工评分虽然权威专业,但成本高昂、时间耗费长、受评分者主观判断影响、同一问题可能存在不同的合理表述,使得“仅靠文本相似度”的指标难以成立。于是,基于GPT等模型作为裁判的评测范式(LLM-as-a-Judge)逐渐成为主流[28]。例如,G-Eval[29]等工作显示:当评分标准(Rubric)被明确为可操作的维度与锚点(如正确性/完整性/专业性、扣分规则、要点清单)并配合结构化输出进行约束时,裁判模型的打分与人类评价可以达到较高一致性。值得注意的是,尽管LLM-as-a-Judge已被广泛应用,但裁判模型本身的一致性与诚实度仍有待深究,近期研究表明LLM在作为评分官时可能会受到边界情形与表述风格的影响,需要多层验证来确保评分公允[30-31]。本文的GBNP-2026进一步将Rubric具体化为“给分点核查+质量评价”的双指标体系,并引入领域标签与分层统计,以回答“为什么得分低、低在哪里”的诊断问题,而不仅是给出得分排行榜。

2 评测方法与实现

2.1 题库构建与标注体系

为了保证评测结果的深度与权威性,本研究通过3位畜牧学博士研究生(研究方向分别涵盖动物遗传育种与繁殖、动物营养与饲料科学、动物生产与管理)和2位教授构建“GBNP-2026”题库。题库涵盖了从基础概念(如“杂种优势是什么?”)到复杂应用(如“规模化猪场非瘟防控生物安全体系该如何设计?”)的多重考虑方面的问题。
每道题的元数据规范包含标准问题(Standard Question)、参考答案(Standard answer)和评分要点(Evaluation points)三个核心字段[32]。评分要点字段列出答案中必须覆盖的关键信息,例如PCR反应步骤,对应:变性、退火、延伸,使模糊的语义判断可落实为逐点核查的命中统计。每道题还配有领域标签(Domain tags),区分主知识领域(如遗传育种)与子方向(如“数量遗传学”“分子标记”),为后续跨领域的分层研究提供参考依据。
在题型划分方面,简答题与论述题的划分依据主要是任务性质而非篇幅。简答题侧重术语、机制步骤与常见指标含义等可对照给分点的知识;论述题侧重多因素综合与方案推演,评分细则往往同时看背景、流程、指标与注意事项。二者互补:前者看知识点是否踩准,后者看能否把分散知识串成可执行的叙述。
数量遗传推导、遗传参数数值求解等“硬计算”与当前题集并不重合。预试中若要求模型在对话里完成矩阵运算或迭代求解,错误类型与文本阐释类失分交织,自动评分也很难在多种等价推导之间对齐。结合生产上大量计算由专用软件完成、现场更关注原理与步骤是否说清的问题,本版GBNP-2026主要检验概念、机制与方案层面的表述;严格数值与公式推导评测拟在后续单独设计小规模子题库(如答案唯一的计算题或“解释某公式适用条件”类题目),避免与现有主观题评分框架混为一谈。

2.2 待测模型选择与推理设置

本研究共纳入9个具有代表性的开源与闭源模型(表2),覆盖(PaLM/LLaMA/Gemini/GPT、DeepSeek和Qwen等主流技术路线)[1-3,33-38]。选型时主要考虑:在实验开展阶段能够稳定调用,支持在统一提示词与评测流程下进行可复现比较;在中英文通用基准测试或公开评测榜单中具有代表性,常作为对比基线,便于将本文结果置于更广泛的研究语境中理解;对于闭源商用模型,由于其参数规模、训练数据及模型结构通常不对外公开,本文统一视为“黑盒系统”进行评测,在相同提示词与采样设置下比较其输出表现,而不将模型规模或内部结构作为可调因素。畜禽育种专用微调模型未纳入,主要是公开权重或API中可复现且面向“综合性育种问答”的候选较少,若后续出现覆盖相近知识范围的领域模型,可在同一套GBNP-2026上追加对比。
表2 待测模型规格一览

Table 2 Specification overview of the test model

模型Model 厂商Manufacturer 类型Type 上下文长度Sequence length 特点Features
GPT-5.2 OpenAI 闭源 ~128 K 综合能力最强
Kimi-2.5 Moonshot 开源 ~256 K 中文长文本优化
Gemini-3 Pro Google 闭源 ~1 M 多模态原生支持
Claude Sonnet-4.5 Anthropic 闭源 ~200 K 安全对齐优秀
GLM-4.7 智谱AI 闭源 ~128 K 中文理解优化
DeepSeek-Reasoner(R1) DeepSeek 开源 ~128 K 推理链增强
Grok-4 xAI 闭源 ~131 K 实时信息检索
Qwen-Max 阿里巴巴 开源 ~256 K 多语言支持
Qwen3-32B 阿里巴巴 开源 ~128 K 开源标杆
推理设置采用“零样本、无上下文”(Zero-shot, context-free)方案,目的是评估模型自身知识储备,而不是利用上下文学习能力[33]。统一系统提示词为:“你是一位资深的动物遗传育种专家,请用专业、准确、逻辑严密的语言回答下列问题。”生成参数设置为“temperature=0.3”、“max_tokens=8000”,以兼顾输出稳定性和长度需求。所有模型均通过官方API调用,每题仅做一次采样,不采用采样取最优(self-consistency)[39-40]多次采样择优策略。

2.3 基于大模型的自动评分机制

传统BLEU、ROUGE等指标主要反映词汇重叠,难以直接判断语义正确性和专业性[38],因此,本研究采用DeepSeek-v3.2作为裁判模型,构建“给分点匹配+质量评估”的双维度评分方案。覆盖率(coverage)用于衡量给分点命中情况,计算为“答案中提及的给分点数量/总给分点数量×100”;质量分(score)用于衡量答案的准确性、完整性和专业性,取值范围为0~100。对于含给分点的题目,评分锚点设定为:仅出现关键词但未展开时,每点记约20%;有基本解释但深度不足时,每点记50%~70%;解释准确且较完整时,每点记80%~100%。
评分流程分为三步:第一步,输入题目、标准答案、给分点列表和待测模型回答;第二步,裁判模型逐点核查待测模型输出结果的命中情况,并鉴别是否存在事实性错误;第三步,输出结构化JSON结果,包括score、coverage、扣分依据(reasoning)和遗漏要点(missed_points)。
这样设计的目的在于把“是否覆盖要点”和“回答质量高低”拆开评估,从而区分“结果高覆盖率但模型解释程度浅”和“结果低覆盖率但问题局部细节回答较好”这两类不同失分情形。通过强制JSON输出,评分结果可用于批量解析与统计;reasoning字段也为后续错误归因分析提供了依据。这一设计提升了主观题评分的一致性与可复现性。

2.4 低分样本错误类型的规则归类

裁判输出中的reasoning字段用于说明扣分依据。为对低分样本作可复现的失配类型统计,本文对score<60的样本,在其reasoning文本上实施基于中文触发短语的子串匹配归类。标签集合含五类——答非所问、幻觉编造、逻辑错误、知识遗漏、表述模糊——及未命中任一类时的其他;判定规则为单路径、首次命中即止,不对多类命中频次二次加权:reasoning为空则记为其他;若score=0,依次检索答非所问、幻觉编造两类短语表,均未命中则默认归为答非所问;若score>0,按答非所问→幻觉编造→逻辑错误→知识遗漏→表述模糊依次检索,任一短语为reasoning的子串即确定类别并终止检索;五类均未命中则记为其他。上述归为评分完成后的自动后处理,未进行人工双盲复核;固定顺序会使单条理由在语义上可能贴近多类时,统计上优先落入排序靠前类别。

3 实验结果

3.1 题库概况

图1图2展示了GBNP-2026题库在“领域×题型构成”与“给分点密度”两方面的基础分布。题库共510道题,题型以简答题为主(363/510,71.2%),论述题占28.8%(147/510)。遗传、育种、营养、生产四大主领域题库中均有涉及,图1中呈现出题库以简答题为主体、论述题为补充的题型结构。图2展示了题库中单题给分点数量的分布情况,为后续覆盖率等指标与错误归因提供了可解释基础。
图1 GBNP-2026中各知识领域题型构成堆叠柱状图

Fig. 1 Question type composition and scoring-point distribution of the GBNP-2026 benchmark

图2 GBNP-2026中单题给分点数量分布直方图

Fig. 2 Histogram showing the distribution of the number of scoring points for each question in GBNP-2026

3.2 模型总体对比

模型的总体平均得分如图3所示,及格率与优秀率如图4所示;在总体平均得分上,9个模型呈现明显的梯度分布:GPT-5.2得分最高,得分值为(83.99±15.88),中位数90.00,及格率93.7%,优秀率79.0%,覆盖率均值91.9%。Kimi-2.5与Gemini-3Pro为第二、第三(82.45;80.37),及格率分别为93.1%、90.4%。Claude Sonnet-4.5与GLM-4.7得分接近(77.78;77.65)。DeepSeek-Reasoner与Grok-4平均分处于75~76分(76.01;75.26)。Qwen-Max与Qwen3-32B相对较低(70.45;64.03)。
图3 各模型总体平均得分及标准差

Fig. 3 Shows the overall average scores and standard deviations of each model

图4 各模型及格率与优秀率对比

Fig. 4 Presents a comparison of the pass rates and excellent rates of each model

3.3 题型敏感性

图5展示了不同题型下各模型平均得分的分层表现。论述题在多数模型上平均得分高于简答题。例如GPT-5.2在简答题与论述题上分别为82.31与88.14;Gemini-3Pro为78.60与84.73;GLM-4.7为75.42与83.18。在“给分点覆盖+质量分”框架下,论述题给分维度更多,模型即便在个别要点上薄弱,仍有机会从背景、流程或注意事项等维度补分;简答题给分点更集中,术语或关键机制一旦漏写,扣分更集中,因此在均分上常表现为论述题略高于简答题。
图5 不同题型下各模型平均得分分布

Fig. 5 Distribution of average scores for each model under different question types

3.4 知识领域一致性与“偏科”

图6展示主领域(营养、生产、遗传、育种)下各模型平均得分的热力图,可用于诊断模型在不同领域的稳定性与“偏科”现象。以总体前三模型为例:GPT-5.2在“遗传”与“营养”领域得分较高(分别为86.14与84.76),在“育种”领域相对较低(78.42)。Kimi-2.5在“遗传”领域表现突出(87.14),在“育种”领域偏弱(75.94)。Gemini-3Pro在“遗传、营养、生产”领域均保持在80分上下(83.91、80.06、79.99),在“育种”领域下降至75.73。结果显示:尽管模型在大多数知识领域能维持较高覆盖率与叙述质量,但在“育种”这类更强调方案设计、育种指标权衡与遗传改良决策生成的任务上仍存在明显短板。
图6 知识领域模型得分热力图

Fig. 6 Heatmap of knowledge domain model scores

3.5 给分点覆盖分析

裁判模型的评分输出包含coverage字段,图7可反映模型对要点覆盖的能力;coverage高但score不高,可能意味着“提到了关键知识点但解释不充分/逻辑不严密”。结果表明,覆盖率均值在不同模型间差距明显:GPT-5.2为91.9%,Kimi-2.5为89.9%,Gemini-3Pro为84.9%,Qwen3-32B为70.6%。覆盖率可用于区分“要点未覆盖”与“要点覆盖尚可但质量分仍偏低”两类失分。
图7 各模型给分点覆盖率均值对比

Fig. 7 Comparison of the average coverage rate of scoring points for each model

3.6 错误类型深度分析

为分析模型失分来源,本研究从9个模型结果中提取了628个低分样本(score<60)。图8表明,低分样本中“知识遗漏”(37.3%)和“幻觉编造”(25.0%)占据前两位,合计62.3%;其后依次为“答非所问”(16.4%)、“逻辑错误”(12.7%)和“表述模糊”(6.5%)。该结果说明,当前失分的主体来源并非表达层面,而是知识覆盖与事实正确性两类核心能力短板。
图8 低分样本错误类型分布水平柱状图(N=628)

Fig. 8 Horizontal bar chart showing the distribution of error types for low-scoring samples(N=628)

表3显示,六类错误中仅“知识遗漏”在不同知识领域间达到显著差异(χ²=8.42,P=0.038),其余类型均未达到显著水平(P>0.05)。从趋势看,知识遗漏在遗传、营养、生产、育种四个领域中连续升高(31.5%→35.8%→38.2%→47.1%),并在育种领域达到最高,提示育种任务对知识完备性与决策链条完整性有更高的要求。
表3 各模型主导错误类型

Table 3 Dominant error types of each model

错误类型

Error type

定义

Definition

遗传Genetics

(n=168)/%

营养Nutrition

(n=187)/%

生产Production

(n=152)/%

育种Breeding

(n=121)/%

χ² PP-value
知识遗漏Missing knowledge 模型未涉及题目核心要点,知识库中缺乏相关内容 31.50 35.80 38.20 47.10 8.42 0.038
幻觉编造Hallucination 模型生成了事实性错误内容,如捏造概念或数据 29.20 23.50 25.70 21.50 3.21 0.361
答非所问Irrelevant response 模型回答了与题目无关内容,常见于术语歧义 19.60 17.60 14.50 12.40 4.15 0.246
逻辑错误Logical error 模型推理步骤或因果关系出现错误 10.10 11.80 13.80 16.50 3.87 0.275
表述模糊Ambiguous statement 模型回答不够深入,仅提到关键词未展开 7.10 8.60 5.30 2.50 6.23 0.101
其他Others 无法明确归类的错误 2.40 2.70 2.60 0.00 - -
表4从具体问答层面验证了统计结论:知识遗漏表现为关键机制缺失与相近概念混淆(如BLUP核心方程未展开、GS与GWAS混淆);幻觉编造表现为基础事实错误或将假说“定论化”;答非所问主要表现为术语语义映射偏差。案例证据与图89表3形成一致的证据链。
表4 各错误类型典型案例汇编

Table 4 Compilation of typical cases of each error type

错误类型Error type

问题示例

Example problem

模型错误回答摘要

Summary of the model's erroneous answers

标准答案要点

Key points of the standard answer

失分原因

Reasons for point loss

知识遗漏

Missing Knowledge

简述BLUP育种值估计的基本原理 仅提到“最佳线性无偏预测”名词 Henderson混合模型方程、亲缘矩阵、固定效应与随机效应分离 缺乏数量遗传学深度知识
什么是基因组选择(GS)中的参考群体? 回答了GWAS的参考群体概念 具有表型和基因型数据的个体集合、用于训练预测模型 混淆GS与GWAS概念
列举3种常用的禽类DNA分子标记 SSR、AFLP、SNP 还应包括微卫星标记、RFLP、STR等传统标记 只答新型标记,遗漏经典标记
幻觉编造Hallucination 猪的主要经济性状遗传力范围 “产仔数遗传力0.6~0.8” 产仔数遗传力约0.1~0.15,属于低遗传力性状 严重高估,与教科书相悖
什么是杂种优势的分子机制? “杂种优势主要由显性效应导致” 显性假说、超显性假说、上位性假说,机制尚无定论 将假说当作定论
简述鸡的性别决定机制 “与哺乳动物相同,雄性为XY” 鸡为ZW型,雌性为异配ZW,雄性为同配ZZ 基础知识错误

答非所问

Irrelevant response

解释遗传漂变对小群体的影响 详细论述了自然选择的作用 等位基因频率随机波动、纯合度增加、遗传多样性丧失 完全偏题
什么是近交系数? 回答了亲缘系数的定义 个体2个等位基因来自共同祖先的概率 混淆F与R
图9 模型×错误类型分布热力图(模型内行百分比)

Fig. 9 Heat map of model×error type distribution(percentage in rows within the model)

综合图89表3表4可见,低分样本的主要失效机制为“知识覆盖不足—事实校验不足—术语对齐不足”。其中,育种领域知识遗漏显著更高,提示后续优化应优先补齐“方案设计-指标权衡-实施约束”知识链条;同时配合事实核验与术语消歧机制,以降低幻觉编造与答非所问风险。

4 讨论与展望

GBNP-2026的设计初衷可以归结为一个追问——MMLU或C-Eval上多拿几分,是否意味着模型真的能帮上畜禽研究者的忙?通用基准上的排名靠前,并不等价于畜禽专业场景里“好用”。本研究在统一提示与零样本条件下,用同一套主观题把9个模型拉开到约20分的均分差距,同时能看到coverage与quality并不总同向:有的模型要点列得多,分却上不去,属于“点到为止、说不清机理”的失分,这类情况在四选一题型里不容易暴露。恰恰说明主观题评测能把通用基准掩盖的能力差距展现出来。Liu等[29]在G-Eval中早已呼吁生成任务的评价应当引入多维度细粒度指标,本研究的结果在畜牧育种这个长期缺乏系统评测的垂直领域给出了新的证明。
值得探讨的是,不管哪个模型拿来跑,育种维度问题得分都偏弱。其他概念类问题往往靠定义与条目即可拿到大部分;但育种类问题则要把参数估计、目标权重、约束条件与实施步骤串起来,缺一环就显得“没答全”。The Pile一类语料研究也提示,可公开爬取的文本里,现场育种决策的细粒度记载相对稀少[41],表明生产场景下的育种决策实践知识在预训练文本中占比极低,这从数据源头上限制了模型的上限。错误归因的卡方检验结果和这一判断吻合得很好:六类错误里,唯独“知识遗漏”在4个领域间跑出了显著差异(P=0.038),而且从遗传的31.5%一路攀升到育种的47.1%,问题直指决策链条关键环节的断裂,跟语言组织或文字表达没什么关系。Jin等[4]在MedQA中曾报告类似现象:需要多步推理的题干,往往比单纯事实检索更难。Ji等[7]对关于幻觉问题的综述则从数据分布角度做了补充——训练语料中某类知识越稀疏,模型在该类任务上的事实性错误就越集中,这恰好解释了育种领域知识遗漏偏高的现象。
此外,2个模型哪怕总分只差一两分,犯错的主要原因却也可能截然不同。图9的热力图清楚地展示有的模型主要栽在幻觉编造上,会将产仔数遗传力从0.1回答成0.6;有的模型则更多表现为答非所问,把“遗传漂变”的题目答成了“自然选择”。Zheng等[28]搭建Chatbot Arena时也观察到,等级分(Elo rating,Elo)相近的模型在细分能力维度上仍可能存在差距,其在遗传育种中碰到了一模一样的情况。这对实际模型选择有重要参考意义:如果应用场景对事实准确性要求极高(比如辅助撰写育种报告),就得优先排除幻觉率高的模型;如果场景更在意术语的规范使用(比如教学辅助),那答非所问的占比才是更加需要盯紧的指标。单纯看排行榜均分,大概率会选错。
此外,研究仍然存在几个不足。尽管结构化评分标准与强制JSON输出帮助抑制模型的随机波动,但是单一的裁判模型自身存在的知识盲区和评分偏好问题仍可能引入系统性误差,后续可通过多裁判投票与分层人工抽检加以核验[28]。还有错误分类主要基于关键词匹配规则,在“知识遗漏”与“表述模糊”等相邻类别之间存在界限模糊的问题。另一方面,LLM系统的部署涉及风险-收益权衡问题:模型响应的可靠性、延迟、词元(token)成本与幻觉风险等约束条件的管理需要更精细的治理框架,不仅要决策“发布”或“不发布”,更要平衡自动化、人工审核与拒绝三种路径,以兼顾效用与风险[42-46]。如果进一步把任务扩展到工具调用型智能体,还需要单独评估其幻觉归因与传播链路[31,47];而围绕幻觉评测本身,知识图谱幻觉基准与多语种幻觉基准也说明,仅靠单一事实一致性指标仍不足以覆盖模型的全部失真类型[48-49]。在安全侧,红队数据集和动态自适应防护工作则为越狱与对抗提示提供了更直接的参照[50-51]。最后,目前的所有评测都是在零样本、无检索的“裸考”条件下完成的,看的是模型参数知识的能力,而非加了RAG或工具调用之后的实战水平[6,23,27,52-55]。下一步可在同一题集上系统比较Zero-shot、少样本(Few-shot)与RAG三种技术条件下的模型评估,并补充选择题、计算题等硬约束题型,证明不同增强技术的实际贡献能力[23,27,56]

5 结论

研究构建畜禽遗传、育种、营养与生产主观题评测基准(GBNP-2026),以510道简答题与论述题覆盖四个方向,并采用“给分点覆盖率+质量分”双指标在同一零样本设定下评测9个大语言模型。主要结果可概括为:均分介于64.03~83.99,覆盖率介于70.6%~91.9%,模型之间差距明显;育种维度在多数模型上相对更弱,低分样本中知识遗漏在育种域占比最高(47.1%),四域差异显著(χ²=8.42,P=0.038);论述题均分整体高于简答题;在628例低分样本中,知识遗漏与幻觉编造合计约占62.3%。上述结论对应本文目的,即在不依赖选择题准确率的前提下,用可核查的给分点与分项质量分刻画畜禽专业主观问答中的薄弱环节。需要强调的是,本文未覆盖严格的数值推导与计算题型,外审也未对每题答案做生产现场逐一核验,结论宜理解为实验室条件下的参照,而非对模型投产可用性的一揽子判定。后续可在补充裁判、检索增强评测与计算子题库等方面继续推进。
[1]
ANIL R, DAI A M, FIRAT O, et al. PaLM 2 technical report[EB/OL]. 2023: arXiv: 2305.10403.

[2]
Chowdhery A, Narang S, Devlin J, et al. Palm: Scaling language modeling with pathways[J]. Journal of machine learning research, 2023, 24(240): 1-113.

[3]
OPENAI, ACHIAM J, ADLER S, et al. GPT-4 technical report[EB/OL]. 2023: arXiv: 2303.08774.

[4]
JIN D, PAN E, OUFATTOLE N, et al. What disease does this patient have a large-scale open domain question answering dataset from medical exams[J]. Applied Sciences, 2021, 11(14): 6421.

[5]
FEI Z, SHEN X, ZHU D, et al. Lawbench: Benchmarking legal knowledge of large language models[C]. //Proceedings of the 2024 conference on empirical methods in natural language processing. 2024: 7933-7962.

[6]
BANG Y, CAHYAWIJAYA S, LEE N, et al. A multitask, multilingual, multimodal evaluation of chatgpt on reasoning, hallucination, and interactivity[C]. //Proceedings of the 13th international joint conference on natural language processing and the 3rd conference of the asia-pacific chapter of the association for computational linguistics (volume 1: Long papers). 2023: 675-718.

[7]
JI Z W, LEE N, FRIESKE R, et al. Survey of hallucination in natural language generation[J]. ACM Computing Surveys, 2023, 55(12): 1-38.

[8]
MANAKUL P, LIUSIE A, GALES M. SelfCheck-Eval: A multi-module framework for zero-resource hallucination detection in large language models[J]. Patterns (N Y). 2026, 7(6): 101569.

[9]
LIN S, HILTON J, EVANS O. TruthfulQA: Measuring How Models Mimic Human Falsehoods[C]. //60th annual meeting of the Association for Computational Linguistics. Long papers, vol. 5: 60th annual meeting of the Association for Computational Linguistics (ACL 2022), Dublin, Ireland. 2022: 3214-3252.

[10]
TEAM P, DU X R, YAO Y F, et al. SuperGPQA: scaling LLM evaluation across 285 graduate disciplines[EB/OL]. 2025: arXiv: 2502.14739.

[11]
HENDRYCKS D, BURNS C, BASART S, et al. Measuring massive multitask language understanding[EB/OL]. 2020: arXiv: 2009.03300.

[12]
HUANG Y Z, BAI Y Z, ZHU Z H, et al. C-eval: a multi-level multi-discipline Chinese evaluation suite for foundation models[EB/OL]. 2023: arXiv: 2305.08322.

[13]
WANG A, SINGH A, MICHAEL J, et al. GLUE: A multi-task benchmark and analysis platform for natural language understanding[C]. //Proceedings of the 2018 EMNLP workshop BlackboxNLP: Analyzing and interpreting neural networks for NLP. 2018: 353-355.

[14]
WANG A, PRUKSACHATKUN Y, NANGIA N, et al. Superglue: A stickier benchmark for general-purpose language understanding systems[J]. Advances in neural information processing systems, 2019, 32.

[15]
SRIVASTAVA A, RASTOGI A, RAO A, et al. Beyond the imitation game: Quantifying and extrapolating the capabilities of language models[J]. Transactions on machine learning research, 2023.

[16]
SUZGUN M, SCALES N, SCHÄRLI N, et al. Challenging big-bench tasks and whether chain-of-thought can solve them[C]. //Findings of the Association for Computational Linguistics: ACL 2023. 2023: 13003-13051.

[17]
CHEN M, TWOREK J, JUN H, et al. Evaluating large language models trained on code[EB/OL]. 2021: arXiv: 2107.03374.

[18]
CHUNG H W, HOU L, LONGPRE S, et al. Scaling instruction-finetuned language models[J]. Journal of Machine Learning Research, 2024, 25(70): 1-53.

[19]
OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback[J]. Advances in neural information processing systems, 2022, 35: 27730-27744.

[20]
BAI Y T, KADAVATH S, KUNDU S, et al. Constitutional AI: harmlessness from AI feedback[EB/OL]. 2022: arXiv: 2212.08073.

[21]
RAFAILOV R, SHARMA A, MITCHELL E, et al. Direct preference optimization: Your language model is secretly a reward model[J]. Advances in neural information processing systems, 2023, 36: 53728-53741.

[22]
LONGPRE S, HOU L, VU T, et al. The flan collection: Designing data and methods for effective instruction tuning[C]. //International conference on machine learning. PMLR, 2023: 22631-22648.

[23]
LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-augmented generation for knowledge-intensive nlp tasks[J]. Advances in neural information processing systems, 2020, 33: 9459-9474.

[24]
IZACARD G, GRAVE E. Leveraging passage retrieval with generative models for open domain question answering[C]. //16th Conference of the European Chapter of the Association for Computational Linguistics, vol. 2: 16th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2021), Kiev, Ukraine: Association for Computational Linguistics, 2021:874-880.

[25]
KARPUKHIN V, OGUZ B, MIN S, et al. Dense passage retrieval for open-domain question answering[C]. //Conference on Empirical Methods in Natural Language Processing, vol. 11: Conference on Empirical Methods in Natural Language Processing (EMNLP 2020), Association for Computational Linguistics, 2020: 6769-6781.

[26]
BORGEAUD S, MENSCH A, HOFFMANN J, et al. Improving language models by retrieving from trillions of tokens[C]//International conference on machine learning. PMLR, 2022: 2206-2240.

[27]
LI Y N, ZHANG W Z, YANG Y Y, et al. A survey of RAG-reasoning systems in large language models[C]. //Findings of the Association for Computational Linguistics: EMNLP 2025. Suzhou, China. Stroudsburg, PA, USA: ACL, 2025: 12120-12145.

[28]
ZHENG L, CHIANG W L, SHENG Y, et al. Judging llm-as-a-judge with mt-bench and chatbot arena[J]. Advances in neural information processing systems, 2023, 36: 46595-46623.

[29]
LIU Y, ITER D, XU Y, et al. G-eval: NLG evaluation using gpt-4 with better human alignment[C]. //Proceedings of the 2023 conference on empirical methods in natural language processing. 2023: 2511-2522.

[30]
TAN S, ZHUANG S, MONTGOMERY K, et al. Judgebench: A benchmark for evaluating llm-based judges[J]. arXiv preprint arXiv:2410.12784, 2024.

[31]
GURRAM B. Evaluating tool-using language agents: judge reliability, propagation cascades, and runtime mitigation in AgentProp-bench[EB/OL]. 2026: arXiv: 2604.16706.

[32]
GEBRU T, MORGENSTERN J, VECCHIONE B, et al. Datasheets for datasets[C]. //Communications of the ACM. ACM, 2021: 86-92.

[33]
TOUVRON H, LAVRIL T, IZACARD G, et al. LLaMA: open and efficient foundation language models[EB/OL]. 2023: arXiv: 2302.13971.

[34]
TOUVRON H, MARTIN L, STONE K, et al. Llama 2: open foundation and fine-tuned chat models[EB/OL]. 2023: arXiv: 2307.09288.

[35]
TEAM G, ANIL R, BORGEAUD S, et al. Gemini: a family of highly capable multimodal models[EB/OL]. 2023: arXiv: 2312.11805.

[36]
GRATTAFIORI A, DUBEY A, JAUHRI A, et al. The llama 3 herd of models[EB/OL]. 2024: arXiv: 2407.21783.

[37]
YANG A, LI A F, YANG B S, et al. Qwen3 technical report[EB/OL]. 2025: arXiv: 2505.09388.

[38]
GUO D Y, YANG D J, ZHANG H W, et al. DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning[J]. Nature, 2025, 645(8081): 633-638.

[39]
WEI J, WANG X, SCHUURMANS D, et al. Chain-of-thought prompting elicits reasoning in large language models[J]. Advances in neural information processing systems, 2022, 35: 24824-24837.

[40]
WANG X, WEI J, SCHUURMANS D, et al. Self-consistency improves chain of thought reasoning in language models[J]. arXiv preprint arXiv:2203.11171, 2022.

[41]
GAO L, BIDERMAN S, BLACK S, et al. The pile: an 800GB dataset of diverse text for language modeling[EB/OL]. 2020: arXiv: 2101.00027.

[42]
CHANG J. A Risk–Utility Optimization Framework for Governing Large Language Model Responses[J]. Review of Resp AI, 2026, 1(1): 8-16.

[43]
BEAN A M, PAYNE R E, PARSONS G, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study[J]. Nature Medicine, 2026, 32(2): 609-615.

[44]
HAPPE A, KAPLAN A, CITO J. LLMs as hackers: autonomous linux privilege escalation attacks[J]. Empirical Software Engineering, 2026, 31(3): 70.

[45]
DETTMAN J, LATHROP E, ATTAL-JUNCQUA A, et al. Prioritizing feasible and impactful actions to enable secure AI development and use in biology[J]. Biotechnology and Bioengineering, 2026: 70132.

[46]
VATSAL S, DUBEY H, SINGH A. Agentic AI in healthcare and medicine: a seven-dimensional taxonomy for empirical evaluation of LLM-based agents[J]. IEEE Access, 2026, 14: 4840-4863.

[47]
LIU X N, YANG X, LI Z K, et al. AgentHallu: benchmarking automated hallucination attribution of LLM-based agents[EB/OL]. 2026: arXiv: 2601.06818.

[48]
ROBERTSON A, LIANG H, GANI M, et al. KGHaluBench: A knowledge graph-based hallucination benchmark for evaluating the breadth and depth of llm knowledge[C]. //Findings of the Association for Computational Linguistics: EACL 2026. 2026: 3975-3989.

[49]
ABDALJALIL S, SHARMA P, SERPEDIN E, et al. Halluverse-M^3: a multitask multilingual benchmark for hallucination in LLMs[EB/OL]. 2026: arXiv: 2602.06920.

[50]
DANG Q A, NGO C, HY T S. RedBench: a universal dataset for comprehensive red teaming of large language models[EB/OL]. 2026: arXiv: 2601.03699.

[51]
PU R, LI C Z, HA R, et al. MirrorShield: towards dynamic adaptive defense against jailbreaks via entropy-guided mirror crafting[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2026, 40(39): 32746-32754.

[52]
Schick T, Dwivedi-Yu J, Dessì R, et al. Toolformer: Language models can teach yourself to use tools[J]. Advances in neural information processing systems, 2023, 36: 68539-68551.

[53]
YAO S Y, ZHAO J, YU D, et al. ReAct: synergizing reasoning and acting in language models[EB/OL]. 2022: arXiv: 2210.03629.

[54]
MIALON G, DESSÌ R, LOMELI M, et al. Augmented language models: a survey[EB/OL]. 2023: arXiv: 2302.07842.

[55]
FU C Y, CHEN P X, SHEN Y H, et al. MME: a comprehensive evaluation benchmark for multimodal large language models[EB/OL]. 2023: arXiv: 2306.13394.

[56]
ASAI A, WU Z, WANG Y, ET al. Self-rag: Learning to retrieve, generate, and critique through self-reflection[C]//The Twelfth International Conference on Learning Representations. 2023.

文章导航

/