结构化评测
把抽象的“效果好”拆成准确性、完整性、可执行性、安全性等可检查指标。
把评测标准、测试样本、回归结果与人工审核组织成质量门禁,判断输出是否准确、完整、安全并满足业务约束。
在线试用 ↘把抽象的“效果好”拆成准确性、完整性、可执行性、安全性等可检查指标。
指出不满足标准的具体内容、影响和可能原因,而不是只给一个总分。
将评测结果用于版本比较和发布判断,避免模型或 Prompt 改动带来质量倒退。
提交待评估 AI 输出和验收标准
Agent 逐项评分并引用问题证据
输出是否通过及修正建议
提交一段 AI 输出和你的验收标准,Agent 会生成结构化评测报告。