Opus 5.2 深夜上线灰度测试,RSI 真的要来了?

Claude Code

最近,AI 开发者社区里流传着一个消息:Anthropic 的新一代模型 Claude Opus 5.2,可能已经在 Claude Code 中悄悄开启灰度测试。

没有发布会,没有官方公告,甚至前端名称都没改。但不少开发者发现,同样是调用"Opus 5",网页版和 Claude Code 的表现却像两个不同时代的模型。有人抓包后注意到,请求背后的模型标识已经发生变化——一个疑似 Opus 5.2 的版本,正在小范围放量。

一次低调的"灰度"

所谓灰度测试,就是先让一部分用户用上新版本,再根据反馈决定是否全面推送。前沿 AI 公司常用这种方式,既能收集真实场景数据,又能避免正式发布后的口碑风险。

有意思的是,这次外界猜测 Anthropic 可能直接跳过了 5.1,一步来到 5.2。当然,这目前只是社区推测,官方并没有确认版本号。

开发者实测:快、准,而且不"偷懒"

从早期反馈看,Opus 5.2 最明显的变化有三个。

第一是快。 相比此前版本,生成速度提升明显,交互更顺滑。

第二是准。 代码输出更干净,废话更少,在复杂任务和长文本处理上完成度更高。

第三是不偷懒。 以前的 AI 遇到长任务,常常写一半就停下,让用户"继续"或者自己补全。而新版本被开发者形容为"工作狂":它会自动多轮迭代,反复检查和修改,直到任务完成。有人把这种表现叫作"严酷循环"。

不过,这些体验目前主要来自部分开发者的主观反馈,并不代表所有用户都会遇到,也不等于官方性能指标。

一个"Tibo"问题,成了版本探测器

怎么判断自己有没有被灰度到?网友想出一个有趣办法。

在 Claude Code 里问一个关于"Tibo"的冷知识,同时关闭联网搜索。旧版模型训练数据里没有这条信息,通常会答不上来;如果被路由到了新模型,则可能准确识别并展开解释。

同一个问题、同样不开搜索,答案却完全不同,开发者因此猜测:背后大概率不是同一套模型权重。当然,这只是一个社区测试方法,并非官方验证手段。

更大的传闻:AI 自我进化?

比灰度测试更引人关注的,是一份网络流传的内部风险报告。

报告提到,Anthropic 内部可能已在广泛使用一个代号为"Model 2"的模型,并让它参与大量代码编写。更长远的目标则指向 RSI——Recursive Self-Improvement,即 AI 能够理解自身架构、修改自身代码,并持续提升智能。

如果这类能力真的成熟,AI 的迭代速度可能会进一步加快。但与此同时,安全、可控性和治理问题也会变得更加突出。

需要强调的是,以上内容来自网络流传和社区讨论,尚未得到 Anthropic 官方证实,大家理性看待。

冷静一点看

Opus 5.2 是否会在本月全面开放?目前没有确定答案。灰度不等于正式发布,开发者实测也不等于最终版本。我们可以关注,但不必过度解读。

真正值得思考的是:当 AI 从"帮人写代码的工具",逐渐变成"参与创造更好 AI 的引擎",行业会走向哪里?普通人又该如何适应?

本文源自 智小鱼