塔斯娱乐资讯网

Astra for Coding: Why Are We Doing This Again?(纯文本摘要) Astra 的整体能力更强,但在软件工程上的表现反而退化 模型在长任务中会持续推进,但产出的代码质量更差 工具调用大量使用 Python,呈现 codegolf 风格 生成的代码可读性差、结构混乱、语义不清晰 单元测试也 ​

网页链接Astra for Coding: Why Are We Doing This Again?(纯文本摘要)Astra 的整体能力更强,但在软件工程上的表现反而退化

模型在长任务中会持续推进,但产出的代码质量更差

工具调用大量使用 Python,呈现 codegolf 风格

生成的代码可读性差、结构混乱、语义不清晰

单元测试也出现 token 优化导致的奇怪格式

子 agent 在无人监督时行为更怪异

长任务成本极高(35 小时、40 亿 tokens、1200 美元)

最终产出无价值,模型不会自动停止

模型训练奖励偏向 token 效率与任务坚持,而非代码质量

复杂度指标(如 cyclomatic complexity)被模型误用

任务命名与结构在长任务中逐渐退化

整体表现像“AGI if you don’t look”——只要不盯着就会发疯

作者认为 AI 工程正在内卷:投入更大,产出更差

Astra 更像为其他行业设计,而非软件工程

作者质疑:为什么我们还用这些模型写代码?

--end--