AI评测省算力,结论会不会变?
做一次完整 AI 安全评测太贵,常见做法是增大 batch、改低精度,或只抽一部分题。问题是:省下来的算力,会不会连“哪个模型更可靠”的结论一起改掉?
【论文事实】一项新研究把完整 BF16、batch size 1 当基线,在 BBQ 与 BBQ-V 两个偏差基准上测试3个模型,共6个“模型×数据集”设置,再逐一改变 batching、INT8、INT4 和评测集大小。它不仅看准确率,还看偏差严重度、偏差出现率、推理质量、不同类别表现、运行时间与 GPU 能耗。
结果一:增大 batch 最稳。六个设置的准确率变化都不超过0.35个百分点,GPU 能量在5个设置下降。但有一例运行时间下降23.1%,GPU 能量反而上升15.3%——跑得快不等于更省电。
结果二:低精度也不自动更省。INT8 的准确率变化不超过0.75个百分点,但六次运行的能耗都是 BF16 的1.79–4.26倍;INT4 则在5个设置里让准确率下降2.40–7.05个百分点,而且对偏差指标的影响方向会随模型变化。
结果三:少做题最容易稳定省能耗,样本比例与 GPU 能量几乎线性缩放。但子集越小,结论越取决于“恰好留下哪些题”:18组匹配比较中,最小子集的波动都高于50%子集。
【专家判断】值得收藏的四步检查表:①保留一次完整 BF16 基线;②同时比较总准确率、偏差、推理质量和分组结果;③直接测 GPU 能耗,别用速度或位宽代替;④缩减题集要固定版本、多次换样本复核,最终结论仍回到完整集确认。
边界:研究只覆盖3个模型、2个基准和单张 A100;偏差与推理质量依赖一个固定 judge;能耗只计推理,不含加载、评审和上传。它没有给出通用“安全误差线”,阈值仍要按业务风险决定。
一手 AI安全 模型量化 大模型
