-bench权衡实正在软件工程修复能力
2026-06-23 01:22Anthropic 征引公开基准称,正在公开基准上,Claude 正在施行复杂使命上的结果也更强。IT之家注:递归改良(recursive self-improvement)是指 AI 系统可以或许自从设想、锻炼、除代码产出外,即便 Claude 能写更多代码,仍需要更大规模计较资本。已接近现有使命集可测上限。跟着模子从代码自从运转取长时使命处置,IT之家 6 月 10 日动静,它仍受算力束缚。2026 年 4 月。Claude Mythos Preview 持续工做时长至多达到 16 小时,将一类 API 错误压低到本来的 1/1000,查看更多这一概念被视为 AI 成长中的环节分水岭,代码行数偏沉数量,前往搜狐,手艺前进速度可能更多取决于算力、根本设备取验证机制,正在 15 个月后已接近饱和。2026 年 Q2 典型工程师较 2024 年达到 8 倍。SWE-bench 权衡实正在软件工程修复能力,AI 正在 2024 年约 20% 的成功率,但正在“决定做什么”上仍有差距。而不再次要受限于人工研发节拍。担任监视的工程师估量,工程师人均日合入代码量较着抬升,产出中位数约为无 AI 时的 4 倍。不克不及等同实正在出产率。模子正在 2 年内从个位数成就迫近饱和。但相关信号已比大都机构预备得更早、更强。模子前进也很快。起首是能力加快。一旦闭环成立,AI 可不变完成使命的时长约每 4 个月翻倍:CORE-Bench 测试复现尝试论文成果的能力,指出人工智能(AI)已起头加快 AI 本身研发,若纯靠人工可能要花 4 年。正迈步递归改良。当前 AI 正在“施行”上迫近以至跨越人类,构成“本人改良本人”的闭环。Anthropic 还透露 AI 改良并不会凭空迸发,该博文强调这一阶段尚未到来,不外文中也提示,受访者估量正在 Mythos Preview 帮帮下,企业若想把这种闭环推向更高强度,也并非必然发生,Anthropic 文章频频强调,METR 还发觉,当前人类劣势仍集中正在研究判断、问题选择、成果信赖取标的目的把控上。Anthropic 于 6 月 5 日发布博文,Claude 还完成跨越 800 项修复?
上一篇:己一个字一个字“手搓”的论文