人工智能大模型评测标准权威文献

大模型通用评测框架、指标体系与可复现基准设计

这些文献共同讨论大模型和生成式人工智能评测的总体框架、基准构建、指标体系、任务设计、标准化流程、可复现性与评测局限,构成评测标准研究的基础方法论。

人类专家、LLM裁判与评测统计有效性

这些研究聚焦人工专家、LLM裁判、多评估者协同及统计检验,分析评估者偏差、裁判一致性、预算分配、隐私保护、专家仲裁和指标与实际效用之间的关系,并延伸到真实世界评测实施。

人类能力、教育测评与文化价值评估

这些文献以标准化考试、教育评价、科学知识、文化能力和多元价值为载体,比较模型与人类能力的差异,关注教育公平、文化适应性、主体性和生成式人工智能对传统评价体系的影响。

基础推理能力与复杂交互任务基准

这些研究评估预训练模型基础能力、参数高效微调后的能力变化、多方对话、图像生成、GUI交互、具身空间推理和复杂推理能力,强调能力结构而非单一总分。

大模型安全、越狱攻击与对抗鲁棒性评测

这些文献围绕内容安全、风险分类、提示注入、越狱攻击、黑盒攻击、安全防御模型、多模态安全泛化和智能体安保展开,重点识别恶意输入、复杂交互及攻击迁移下的失效模式。

评测有效性、模型稳定性与可靠性诊断

这些研究针对数据污染、记忆泄漏、语义等价输入不稳定、知识遗忘、可视化诊断、不确定性校准和反事实能力差异,强调评测结果的可靠性、可解释性和诊断深度。

可信人工智能、风险治理与全生命周期合规保障

这些文献将模型评测与可信人工智能、NIST风险管理、前沿模型保障、关键基础设施安全、合规审计、组织成熟度和软件开发生命周期相结合,强调可治理、可审计和持续保障。

多模态基础模型融合、推理与交互能力评测

这些文献评估视觉—语言、生物医学多模态、物理世界理解、跨模态推理、全双工视听交互、医学影像和三维语义能力,关注融合质量、机制解释、物理或生物学合理性及多模态幻觉。

科学、工业与真实世界应用基准

这些研究把评测标准落实到科学假设生成、食品合规、数值天气、司法摘要、世界模拟、图推理、工业任务、材料生成、电商设计和真实机器人等场景,强调领域有效性、真实分布、可解释性和物理合理性。

医疗健康大模型的临床、安全与用户中心评测

这些文献面向中文医学、电子健康记录、临床任务、医疗安全、医学人工智能标准和健康辅助应用,综合考察知识、诊断、写作、安全、用户信任、同理心及临床实际有效性。

智能体规划、自演化与动态过程能力评测

这些研究关注工具增强型和自主智能体的规划、自演化、反馈归因、资源效率及科学研究判断,评测对象从静态输出扩展到动态过程、任务闭环和长期行为。

数据基础设施、推理效率与基础模型生态评测

这些文献关注国家级数据与语料基础设施、云边端推理的性能—能耗—成本权衡,以及基础模型开源生态影响,扩展了从单模型能力到数据、部署和生态系统的评测范围。

人工智能大模型评测标准权威文献

合并后形成十二个相互并列的方向:通用评测框架与基准方法、人类及教育文化能力、基础推理与复杂交互、安全与对抗鲁棒性、可靠性与稳定性诊断、可信治理与生命周期保障、多模态能力、科学工业真实世界应用、医疗健康评测、智能体动态能力,以及数据基础设施与模型生态。整体体现出大模型评测从单一准确率和静态排行榜,逐步发展为覆盖可复现性、评估者可靠性、安全风险、校准解释、领域有效性、动态行为、部署成本和全生命周期治理的多维标准体系。

共 136 篇文献,12 个研究方向
大模型通用评测框架、指标体系与可复现基准设计
这些文献共同讨论大模型和生成式人工智能评测的总体框架、基准构建、指标体系、任务设计、标准化流程、可复现性与评测局限,构成评测标准研究的基础方法论。相关文献:Yuling Gu et. al, 2025 等 23 篇文献
人类专家、LLM裁判与评测统计有效性
这些研究聚焦人工专家、LLM裁判、多评估者协同及统计检验,分析评估者偏差、裁判一致性、预算分配、隐私保护、专家仲裁和指标与实际效用之间的关系,并延伸到真实世界评测实施。相关文献:Camilo Chacón Sartori et. al, 2026 等 16 篇文献
人类能力、教育测评与文化价值评估
这些文献以标准化考试、教育评价、科学知识、文化能力和多元价值为载体,比较模型与人类能力的差异,关注教育公平、文化适应性、主体性和生成式人工智能对传统评价体系的影响。相关文献:Wanjun Zhong et. al, 2024 等 10 篇文献
基础推理能力与复杂交互任务基准
这些研究评估预训练模型基础能力、参数高效微调后的能力变化、多方对话、图像生成、GUI交互、具身空间推理和复杂推理能力,强调能力结构而非单一总分。相关文献:Shaobo Wang et. al, 2026 等 6 篇文献
大模型安全、越狱攻击与对抗鲁棒性评测
这些文献围绕内容安全、风险分类、提示注入、越狱攻击、黑盒攻击、安全防御模型、多模态安全泛化和智能体安保展开,重点识别恶意输入、复杂交互及攻击迁移下的失效模式。相关文献:Paul Röttger et. al, 2025 等 22 篇文献
评测有效性、模型稳定性与可靠性诊断
这些研究针对数据污染、记忆泄漏、语义等价输入不稳定、知识遗忘、可视化诊断、不确定性校准和反事实能力差异,强调评测结果的可靠性、可解释性和诊断深度。相关文献:Anany Kotawala et. al, 2026 等 7 篇文献
可信人工智能、风险治理与全生命周期合规保障
这些文献将模型评测与可信人工智能、NIST风险管理、前沿模型保障、关键基础设施安全、合规审计、组织成熟度和软件开发生命周期相结合,强调可治理、可审计和持续保障。相关文献:Aleksandra Nastoska et. al, 2025 等 14 篇文献
多模态基础模型融合、推理与交互能力评测
这些文献评估视觉—语言、生物医学多模态、物理世界理解、跨模态推理、全双工视听交互、医学影像和三维语义能力,关注融合质量、机制解释、物理或生物学合理性及多模态幻觉。相关文献:Paul Pu Liang et. al, 2024 等 12 篇文献
科学、工业与真实世界应用基准
这些研究把评测标准落实到科学假设生成、食品合规、数值天气、司法摘要、世界模拟、图推理、工业任务、材料生成、电商设计和真实机器人等场景,强调领域有效性、真实分布、可解释性和物理合理性。相关文献:A. Lew et. al, 2026 等 9 篇文献
医疗健康大模型的临床、安全与用户中心评测
这些文献面向中文医学、电子健康记录、临床任务、医疗安全、医学人工智能标准和健康辅助应用,综合考察知识、诊断、写作、安全、用户信任、同理心及临床实际有效性。相关文献:Yan Cai et. al, 2024 等 10 篇文献
智能体规划、自演化与动态过程能力评测
这些研究关注工具增强型和自主智能体的规划、自演化、反馈归因、资源效率及科学研究判断,评测对象从静态输出扩展到动态过程、任务闭环和长期行为。相关文献:Yee Hin Chong et. al, 2026 等 4 篇文献
数据基础设施、推理效率与基础模型生态评测
这些文献关注国家级数据与语料基础设施、云边端推理的性能—能耗—成本权衡,以及基础模型开源生态影响,扩展了从单模型能力到数据、部署和生态系统的评测范围。相关文献:李兴腾 et. al, 2025 等 3 篇文献