目的 畜禽领域问答往往术语密集、推理链条长,且常涉及指标、参数与方案的权衡;本文从主观题作答与评分细则出发,考查大语言模型在畜禽领域场景中的专业可用性。 方法 构建中文垂直测评基准,即畜禽遗传、育种、营养与生产测评基准(Genetics,breeding,nutrition,and production benchmark,GBNP-2026),收录主观题510道(简答363道、论述147道);每题配有标准答案、可核查给分点与领域标签。在零样本、无上下文条件下,对9个开源与闭源模型统一评测,采用“给分点覆盖率+质量分”双维度自动评分,并对低分样本作错误归因与跨领域比较。 结果 模型总体得分呈梯度分布,平均分64.03~83.99,覆盖率70.6%~91.9%;论述题得分整体高于简答题;育种领域在多数模型中得分最低。低分样本628例中,知识遗漏占37.3%,幻觉编造占25.0%;知识遗漏比例在领域间差异显著(χ²=8.42,P=0.038)。 结论 与单纯依赖选择题准确率相比,融合覆盖率与质量分的主观题评测有助于区分模型在畜禽专业场景中的能力差异与薄弱环节,但对严格数值推导类任务仍需另行设计题型加以验证。