塔斯娱乐资讯网

把一份 35 到 50 条过往轨迹压成几百 token 的小技能卡,扔进系统提示

把一份 35 到 50 条过往轨迹压成几百 token 的小技能卡,扔进系统提示里,就能替掉 GPT-5.4-mini 的推理模式,输出 token 直接砍掉 2.9 到 4.5 倍——这是微软新论文《Reason Wide, Not Deep》给出的招数。受影响的,是所有跑智能体团队的算力账单。

做法是让 GPT-5.4-mini 类模型从历史轨迹里挑出反复翻车的模式,转写成一段 markdown 技能,再挂到非推理模型的系统提示上。在四个智能体基准上,这些卡片能补回推理与非推理模式之间 55% 到 100% 以上的差距,ALFWorld 和 τ²-retail 上甚至反超了推理模式。微软把这叫“推理成本一次付清”,把搜索路径提前烧掉,运行时不再烧算力。

但不是所有任务都吃这套。论文点出 telecom 和 SpreadsheetBench 这类依赖每条实例独立信息的任务,推理模式依然胜出。技能卡擅长处理“流程重复、模式可枚举”的活儿,一旦答案藏在某条具体记录里必须现场去查,提前压都压不出来。

另一个常被忽略的成本在输入侧:技能卡常驻系统提示,每一轮对话都要重新走一遍输入 token。能不能真省钱,取决于任务重复率、技能命中率和上下文预算。

更务实的分工:流程型任务交给蒸馏技能,个体差异大、需要现场推理的留给测试时推理。两条腿走路,比押注任何一边都稳。

你跑智能体时,更心疼的是单次推理烧掉的输出 token,还是系统提示长期挂着技能吃掉的输入开销?