算法效果报告容易受样本、参数和指标口径影响。没有统一评估体系时,每次结果看似完整,却无法与上一次公平比较。
固定评估上下文
一次评估记录样本集版本、基线版本、候选算法版本、参数、运行环境和指标实现版本。报告只引用这些不可变对象。
样本需要分层
总体均值会掩盖特定场景退化。样本按内容类型、质量区间和处理难度分层,报告同时展示总体与分层结果。
客观与主观结合
客观指标适合大规模筛选,主观评测用于验证真实感知。两者不一致时,应保留样本级差异,而不是强行合成一个总分。
自动生成报告
评估任务完成后生成结构化结果和版本化报告,包括失败样本、置信区间和与基线的差异。失败样本不能从分母中静默消失。
可重复评估让算法优化从“展示几个好例子”变成可以持续追踪的工程过程。