SWE-bench 高分,为什么在大厂 Kotlin 项目里照样抓瞎?
为什么 SWE-bench 高分,在大厂 Kotlin 项目里依然会打转?
JetBrains 在 2026 年 7 月 24 日发布了 Kotlin Benchmark,用 8 个开源项目的 105 个真实任务测 AI 编程助手。同样用 Opus 4.7 模型,Claude Code 成功率 85.71%,JetBrains 自家的 Junie 是 81.9%,差了近 4 个百分点。差距不在模型本身,而在外层 Harness...
推荐理由:JetBrains 官方基准测试给出了具体数字和工程层面的拆解,不是泛泛抱怨排行榜失真,而是追溯到静态编译开销 vs Python 动态运行反馈的根因。扣分点在于文章本身没披露更多任务细节和失败模式,但作为一条快讯,信息密度和判断力都够。