跳到正文

免费视频 · E08

评估:Golden Set 与 LLM-as-judge

中文配音 · 中文字幕 · 15:45 · 视频发布于

本系列使用 AI 辅助配音;配音与示例内容均需以页面声明和文字课程为准。 示例为教学情境,不代表真实客户结果。

本集概要

从提示词变更可能影响旧工单判断的问题出发,学习评估集、期望要点与禁止项。区分软件测试和模型评估,理解 Golden Set 分层、模型裁判偏差及人工复核。

  • 将正确性、幻觉、格式、成本和延迟分开记录,避免总分掩盖红线失败。
  • 评估集应覆盖常规、边界和历史失败,并保留版本与基线。视频中的样本数和配比是教学起点,不是通用质量门槛。
  • 模型裁判需要明确评分细则、人机抽检和偏差检查。交换顺序或更换裁判不能保证消除偏差,规则与模型证据仍须分别核验。

这是按本集内容整理的学习概要,不是逐字稿;概念边界请结合文字课程核对。

看完后动手练习

整理一个合成用例表,逐条写输入、期望要点、禁止项和判定依据。仅分析合成记录时明确标注,实际模型输出与成绩留待真实运行。

打开练习、示范与参考 →