AI 写代码,次高思考档为什么在一项评测里
AI 写代码不是想得越久越好。Anthropic 的 Sonnet 5.5 模型就翻了车:在 FrontierCode 评测里,最高思考档得分反而比次高档低了近 6%。
评测看的是“能不能直接合并”。这可不是光代码跑通就行。它还得符合项目规范、测试到位,而且绝对不能超出题目要求的范围。
最高档容易因为“过度审查”被扣分。开到最高档后,AI 会启动额外的代码审查。这不仅拖慢速度导致超时,还经常顺手改了不该改的地方。结果就是白忙活一场,反而没达到验收标准。
所以用 AI 写代码,别无脑开最高档。先定好交付范围和截止时间,再决定要不要加审查。
原文AI 写代码,次高思考档为什么在一项评测里赢了最高档?