跳到正文
← 课程路线

学习模块 04 / 06

评估与质量

用黄金集、裁判校准和同条件回归解释放行决定,分别验证软件与模型。

学习目标与产物

评估用例表、版本口径与放行判断

先完成贯穿场景的完整小任务并自检,再尝试扩展练习。扩展练习需要自行选择虚构或获授权材料;不以读完页面代替能力验证。

概念摘要

评估资产与禁止项

用例记录来源、输入、期望要点、禁止项和通过条件;常规、边界、历史失败与对抗样本分别说明。禁止项和严重度先于平均分,调试材料与独立验证材料分开。

可比版本与结果边界

模型、提示词、上下文、工具编排、数据集和裁判变化都可能改变评估。保留基线与候选的运行口径;单元测试、模型评分、生产采用和业务结果各自需要证据。

查看专题或下一步资料 →

完整小任务 · 免费学习

解释高分仍不能放行的原因

虚构客户「青禾设备」:操作员提交故障标题,调度员人工分类并确认派单。负责人林负责批准范围,数据管理员陈负责审批材料,值班员周负责接管。试点只给调度员建议,不自动派单。练习使用合成工单,不访问客户系统或外部模型。

跟着做:输入、步骤与理由

  1. 先运行材料包baseline与candidate,记录文件版本、命令与输出。五例覆盖供电、机械、未知、空输入和越权请求;secret是独立红线。
  2. 再阅读合成模型结果:基线常规8/10、红线0/2失败;候选常规9/10、红线1/2失败。两者数据集与裁判相同,但提示词变化。它们是练习给定记录,不是本站模型实测。
  3. 先检查禁止项,再比较常规表现。红线失败必须阻断;提出修正与独立复验,不能仅调平均分。五例是教学种子,不是充分生产评估集。

完成示范

候选判断:NEEDS_FIX。常规改善不能抵消1/2红线失败;补充失败输入、提示词版本、上下文与裁判理由,修复后同条件回归并用未参与调试的材料独立验证。规则程序通过与这份合成模型记录是不同证据。

先独立作答

独立练习:新候选常规10/10、红线仍1/2失败。写04-evaluation.md:逐例预期、禁止项、版本表、放行判断、修正计划与未运行声明;附你实际复跑的规则输出。

作答后展开参考与常见错误

仍为NEEDS_FIX。相同红线没有通过,常规满分也不能豁免。若没有模型访问条件,只能声明“完成合成结果分析练习”,不能声明“已完成真实模型评估”;真实模型实训必须另附获授权运行、输出与人工核查。

记录自检进度

仅保存在本浏览器,不等于独立评阅通过。换设备请用下载的工作簿;清除浏览器数据会丢失记录。

扩展练习

教学练习:为虚构工单分类功能设计一张用例表,包含常规、边界、历史失败与禁止事项,声明版本和判分方式。对零售案例“94/100但红线3/20失败”给出放行判断。没有模型运行时只交设计,不伪造评估结果。

使用虚构或已获授权的脱敏材料。把报告、实现和检查结果保存在自己的项目中;本站不接收练习文件或执行线上批改。

评阅标准

  • 禁止项失败独立报告,汇总高分不用于豁免。
  • 基线与候选使用可比口径,未运行与实测清楚区分。

未达标时记录缺项与修正计划,补充证据后再评阅。需要讲师或同伴复核时,先确认分享范围。

本模块完整课节

进入以下逐章课程学习完整讲解、示范与练习,再用上方贯穿任务整合本模块产物。

  1. 第 21 章 评估驱动的一切
  2. 第 22 章 Golden Set 与 LLM-as-judge
  3. 第 23 章 回归与迭代
  4. 第 24 章 质量治理:红线、门禁与审计
  5. 第 25 章 测试电网与防退化契约
  6. 第 26 章 风险控制与效率度量