塔斯娱乐资讯网

大模型评测 Rubric 到底应该写多细? 《Rubric 工程化实践》02

大模型评测 Rubric 到底应该写多细?
《Rubric 工程化实践》02

Rubric 的粒度,指一条规则一次要完成多少个可以独立判定的质量判断。它和句子长短没有直接关系。

以商品 AI 搜索为例,用户要求推荐价格不超过 1500 元、使用 USB-C、支持主动降噪,并且开启降噪后的续航不少于 30 小时的耳机。

“每款候选是否满足全部要求”看起来很短,实际把价格、接口、降噪和续航四个判断混在了一起。结果失败后,只知道“没满足需求”,不知道具体该修哪里。

即使只看续航,也可能继续拆成两条:引用的数值是否来自“开启降噪”条件,以及条件匹配后数值是否达到 30 小时。前者失败要修参数口径,后者失败要修候选过滤或硬约束判断。

什么时候应该拆?

① 两个条件可以独立通过或失败;
② 判定时需要读取不同证据;
③ 失败后对应不同的修复动作。

什么时候应该停?

新拆出的条目读取同一份证据、标签总是一起变化、失败后也指向同一个修复动作。继续拆成固定词语、句序和答案位置,只会重复扣分,并误伤等价表达。

大模型 大模型评测 Rubric LLMJudge AI搜索 算法工程师