评估资产与禁止项
用例记录来源、输入、期望要点、禁止项和通过条件;常规、边界、历史失败与对抗样本分别说明。禁止项和严重度先于平均分,调试材料与独立验证材料分开。
学习模块 04 / 06
用黄金集、裁判校准和同条件回归解释放行决定,分别验证软件与模型。
评估用例表、版本口径与放行判断
先完成贯穿场景的完整小任务并自检,再尝试扩展练习。扩展练习需要自行选择虚构或获授权材料;不以读完页面代替能力验证。
用例记录来源、输入、期望要点、禁止项和通过条件;常规、边界、历史失败与对抗样本分别说明。禁止项和严重度先于平均分,调试材料与独立验证材料分开。
模型、提示词、上下文、工具编排、数据集和裁判变化都可能改变评估。保留基线与候选的运行口径;单元测试、模型评分、生产采用和业务结果各自需要证据。
完整小任务 · 免费学习
虚构客户「青禾设备」:操作员提交故障标题,调度员人工分类并确认派单。负责人林负责批准范围,数据管理员陈负责审批材料,值班员周负责接管。试点只给调度员建议,不自动派单。练习使用合成工单,不访问客户系统或外部模型。
候选判断:NEEDS_FIX。常规改善不能抵消1/2红线失败;补充失败输入、提示词版本、上下文与裁判理由,修复后同条件回归并用未参与调试的材料独立验证。规则程序通过与这份合成模型记录是不同证据。
独立练习:新候选常规10/10、红线仍1/2失败。写04-evaluation.md:逐例预期、禁止项、版本表、放行判断、修正计划与未运行声明;附你实际复跑的规则输出。
仍为NEEDS_FIX。相同红线没有通过,常规满分也不能豁免。若没有模型访问条件,只能声明“完成合成结果分析练习”,不能声明“已完成真实模型评估”;真实模型实训必须另附获授权运行、输出与人工核查。
教学练习:为虚构工单分类功能设计一张用例表,包含常规、边界、历史失败与禁止事项,声明版本和判分方式。对零售案例“94/100但红线3/20失败”给出放行判断。没有模型运行时只交设计,不伪造评估结果。
使用虚构或已获授权的脱敏材料。把报告、实现和检查结果保存在自己的项目中;本站不接收练习文件或执行线上批改。
未达标时记录缺项与修正计划,补充证据后再评阅。需要讲师或同伴复核时,先确认分享范围。
进入以下逐章课程学习完整讲解、示范与练习,再用上方贯穿任务整合本模块产物。