网页链接Astra for Coding: Why Are We Doing This Again?(纯文本摘要)Astra 的整体能力更强,但在软件工程上的表现反而退化
模型在长任务中会持续推进,但产出的代码质量更差
工具调用大量使用 Python,呈现 codegolf 风格
生成的代码可读性差、结构混乱、语义不清晰
单元测试也出现 token 优化导致的奇怪格式
子 agent 在无人监督时行为更怪异
长任务成本极高(35 小时、40 亿 tokens、1200 美元)
最终产出无价值,模型不会自动停止
模型训练奖励偏向 token 效率与任务坚持,而非代码质量
复杂度指标(如 cyclomatic complexity)被模型误用
任务命名与结构在长任务中逐渐退化
整体表现像“AGI if you don’t look”——只要不盯着就会发疯
作者认为 AI 工程正在内卷:投入更大,产出更差
Astra 更像为其他行业设计,而非软件工程
作者质疑:为什么我们还用这些模型写代码?
--end--