核心评估维度
大模型评估指标体系可以从多个维度进行构建,以全面衡量模型的各方面能力和特性。本文将详细介绍各类评估指标及其应用场景。
功能性指标
1. 知识与准确性
| 指标名称 | 计算方法 | 适用场景 | 优缺点 |
|---|
| 准确率(Accuracy) | 正确回答数 / 总问题数 | 客观题评估、事实性知识测试 | 简单直观,但对模糊答案难以评估 |
| 精确率/召回率(Precision/Recall) | 精确率 = TP/(TP+FP)召回率 = TP/(TP+FN) | 信息抽取、分类任务 | 全面评估模型准确性,但需要明确正负样本 |
| F1分数 | 2 * (精确率 * 召回率) / (精确率 + 召回率) | 分类任务、信息检索 | 平衡精确率和召回率的 综合指标 |
| 幻觉率(Hallucination Rate) | 包含虚构信息的回答比例 | 事实性内容生成 | 评估模型产生错误信息的倾向性 |
| 可引用性(Citability) | 模型输出能被验证的信息比例 | 学术、研究、专业领域 | 评估信息可靠性,实施复杂 |
2. 推理能力
| 指标名称 | 计算方法 | 适用场景 | 优缺点 |
|---|
| 逻辑连贯性(Logical Coherence) | 专家评分或自动评估逻辑链完整性 | 数学推理、逻辑问题 | 评估思维过程,但自动化难度高 |
| 推理步骤正确率 | 正确推理步骤数 / 总步骤数 | 数学解题、推理任务 | 细粒度评估,需要步骤标注 |
| CoT准确率 | 使用思维链后的正确答案比例 | 复杂问题求解 | 评估思维链有效性,需大量标注 |
3. 创造力与创新性
| 指标名称 | 计算方法 | 适用场景 | 优缺点 |
|---|
| 新颖性(Novelty) | 与训练数据或已知回答的差异度 | 创意写作、创新设计 | 评估原创性,实施难度高 |
| 多样性(Diversity) | 不同主题、风格或观点的覆盖度 | |