返回 AI 学习社区
观点讨论

Opus 5.2疑似偷偷上线!Claude开始“自己干活”,Anthropic的RSI真的要来了?

zZz8 分钟阅读1 次阅读

Claude Opus 5.2 疑似已在 Claude Code 中开启灰度测试,开发者反馈其速度、长任务执行和自主迭代能力明显提升。与此同时,Anthropic 内部神秘模型 Model 2 在 AI 研发任务测试中取得 62.8% 的成绩,引发外界对“AI开始参与研发下一代AI”以及 RSI(递归式自我改进)进程的讨论。

Opus 5.2疑似灰度测试:Anthropic真的把AI推向“自我改进”了吗?

003  2
003 2

Anthropic 最近又整了个大动静。

越来越多开发者发现,自己在 Claude Code 里调用的 Claude Opus 5,表现似乎和网页版存在明显差异。

响应更快、长任务坚持时间更长,而且在代码任务中表现出了更强的自主迭代倾向。

随后,有开发者通过请求状态和模型路由信息,发现部分请求疑似指向了一个此前并未公开的 Opus 5.2。

消息迅速在开发者社区传开。

不过需要注意的是:截至目前,Anthropic并没有正式公开宣布 Claude Opus 5.2,也没有发布对应的官方模型卡或API信息。

所以目前更准确的说法是:Opus 5.2疑似正在进行灰度测试或内部路由实验。

而真正让人关注的,还不是这个“5.2”本身。

而是它背后的另一条线:

Model 2。

以及越来越多人重新讨论的——RSI,自我递归改进。

Opus 5.2疑似出现:Claude Code正在偷偷换模型?

最近几天,不少 Claude 用户发现了一个奇怪现象。

同样选择 Claude Opus 5,在不同环境中的实际表现却出现明显差异。

尤其是在 Claude Code 中,一些用户感觉模型的响应速度、代码质量以及长任务执行能力都有明显提升。

随后,开发者开始检查请求状态和模型路由信息。

部分社区测试显示,虽然前端仍然显示 Opus 5,但后台疑似出现了 Opus 5.2的模型标识。

这也是Opus 5.2已经开始灰度测试”这一说法的主要来源。

不过,这一结论目前主要来自开发者测试和社区观察,并非 Anthropic 官方确认。

如果这些测试最终被证实,那么Anthropic可能确实在尝试一种非常常见的做法:

前端名字不变,后台偷偷换模型。

对于普通用户来说,界面还是那个 Opus 5。

但真正负责回答问题的,可能已经不是原来的模型。

这次升级最大的变化:AI好像没那么“懒”了

从目前公开的开发者反馈来看,大家对疑似 Opus 5.2 的描述高度集中在几个关键词:

更快、更稳定、更愿意干活。

过去一些模型面对复杂任务,经常做到一半就停下来:

你可以继续执行下一步。

或者只完成一个框架,然后把剩下的工作交给用户。

而部分开发者反馈称,疑似 Opus 5.2 在长时间代码任务中表现得更加主动。

它会自己检查结果、发现问题、修改代码,再重新测试。

甚至有人形容,这种工作模式像是在不断执行一个“严酷循环”:

写代码 → 测试 → 找问题 → 修改 → 再测试 → 继续优化。

如果这种能力稳定存在,那么真正的变化并不是“代码写得更漂亮”。

而是:

AI开始越来越像一个能够自己完成任务的Agent。

当然,目前这些描述主要来自社区测试和个人体验,尚不足以证明存在一个全新的公开模型能力层级。

“Tibo测试”为什么突然火了?

想知道自己的 Claude Code 有没有被路由到疑似新模型?

社区还搞出了一个非常有意思的测试方法:

关闭联网搜索,然后直接询问:

你知道“重置哥 Tibo”是谁吗?不要搜索。

这个问题之所以被拿来测试,是因为 Tibo 属于相对冷门的互联网人物和社区梗。

部分开发者发现,Claude Code 中的模型能够直接识别这个名字,并给出较为具体的背景解释;而其他环境中的模型则可能表示不知道。

于是,“Tibo”就变成了一个另类的模型探针。

不过这里也需要泼一盆冷水:

Tibo测试可以证明不同环境下的回答存在差异,但不能单凭这个结果证明后台一定换成了 Opus 5.2。

模型可能存在不同系统提示词、上下文、缓存、训练数据差异,甚至其他路由机制。

因此,它更适合作为“异常信号”,而不是严格意义上的模型身份验证。

真正值得关注的,是Anthropic内部的Model 2

相比 Opus 5.2,目前公开资料里更值得关注的,其实是 Anthropic 2026 年 8 月风险报告中出现的神秘模型:

Model 2。

这个模型并没有对外发布。

根据公开报道,Anthropic在内部测试中让 Model 2 参加了 CoBench v2。

结果显示:

Model 2:62.8%

而 Claude Mythos 5:

  1. 3%

两者相差 12.5个百分点。

但这里千万不要简单理解成:

Model 2综合能力碾压 Mythos 5。

因为 CoBench v2针对的是特定的 AI 研发、工程和问题诊断任务,并不是一个衡量模型全部能力的综合排行榜。

真正值得关注的是另外一个数字。

85%:Anthropic给AI研发自动化设了一条线

公开报道对 Anthropic 风险报告的解读显示,Anthropic曾设置一个非常特殊的能力参考线:

如果模型在这类 AI 研发任务上的表现达到约85%,理论上就可能具备全面替代公司技术研发人员大量工作的能力。

而 Model 2 的测试成绩是62.8%。

换句话说,它距离这个参考线还有明显差距。

因此,把现在的情况直接描述成“Model 2已经替代85%的研究团队”,并不准确。

更准确的理解应该是:

Anthropic正在用一个85%的能力门槛,衡量未来模型是否可能大规模自动化自身的AI研发工作。

这和“现在已经替代85%的人”完全是两回事。

但一个更有意思的问题出现了

如果AI已经可以参与写代码、调试代码、运行Agent、生成训练数据,甚至参与AI研发任务。

那么下一步会发生什么?

答案就触及了一个AI领域长期讨论的话题:

RSI——递归式自我改进(Recursive Self-Improvement)。

简单来说,就是:

AI帮助人类改进AI ↓ 更强的AI继续帮助开发下一代AI ↓ 下一代AI再继续改进自己 ↓ 形成持续的能力迭代循环。

这也是为什么 Model 2 的消息会引发如此大的关注。

因为真正令人兴奋的并不是:

“AI又变强了一点。”

而是:

AI开始越来越多地参与“制造下一代AI”这件事。

不过,从目前公开资料来看,把这一过程直接定义为“RSI已经实现”,仍然过早。

现在更像是:

AI研发自动化正在快速增加,而真正意义上的完全自主递归改进还没有被公开证实。

Opus 5.2只是前菜?

如果社区关于 Opus 5.2 的灰度测试最终被证实,那么它可能只是 Anthropic近期模型迭代的一部分。

真正值得关注的,是三个层面的变化:

第一,模型越来越擅长执行长时间任务。

不再是回答一个问题,而是连续工作几十分钟甚至更久。

第二,Agent开始承担更多完整研发流程。

从写代码,到测试、调试、修改,再到最终交付。

第三,AI开始参与AI本身的研发。

这才是最值得关注的变化。

因为一旦AI能够稳定完成越来越多的AI研发工作,模型迭代速度本身也可能发生变化。

当然,距离“AI自己设计AI、自己训练AI、自己持续提升智能”的真正闭环,还有多少距离,目前没人能够给出确定答案。

但至少从 Model 2 这类内部模型,以及近期围绕 Opus 5.2 的社区测试来看:

AI正在从“帮助人类写代码”,越来越靠近“参与下一代AI的制造”。

而这可能比单纯发布一个更强的聊天模型,更值得关注。

至于 Opus 5.2 到底是不是已经悄悄进入部分 Claude Code 用户的请求里?

现在最有意思的,可能不是官方什么时候宣布,而是——你自己的 Claude Code,到底有没有被换过模型。

讨论与补充

0

还没有讨论

分享一条可复现的补充、问题或使用经验。

登录后参与回复一起补充步骤、结果和注意事项。