大模型 · 评测

建立自己的模型评测样例与质量门

用固定样例、明确标准和可复核证据判断模型是否适合工作,而不是只看一次惊艳回答。

本页目录

学完这一篇,你应该能够

  • 设计正常、缺失与冲突样例
  • 区分事实正确与表达质量
  • 记录回归结果和失败模式

一次成功不代表稳定

生成具有随机性,输入也会变化。至少用多组样例重复测试,并保留模型、日期、输入、输出和评分,才能判断改动是否真正改善。

测试集必须包含不顺利的世界

只测试资料齐全的理想案例,会掩盖系统在真实工作中的弱点。加入字段缺失、来源冲突、格式异常和越权请求,观察模型是否会提问、拒绝猜测或请求人工处理。

  • 正常样例:验证基本能力
  • 边界样例:验证规则和停止条件
  • 冲突样例:验证证据优先级
  • 回归样例:确保修复没有破坏旧能力

质量门要能被别人复核

评分应拆成事实、完整性、格式、边界和可用性。关键字段尽量使用通过或不通过,主观表达再使用等级评分,并保存理由。

动手练习

为同一任务写三个测试样例:一个正常、一个缺信息、一个信息冲突;为每个样例写出预期行为和禁止行为。

完成标准

  • 测试不再只包含理想输入
  • 评分标准能区分事实与表达
  • 每次模型或提示词变更都能做回归比较

资料说明

根据 PandaUp 课程逐字稿、课程母版与脱敏实践材料重新编写。本文为公开原创整理,不是录音或课件的逐字转载;涉及产品能力、价格、政策和其他时效信息时,请以使用当日的官方资料为准。