Opus 5.2疑似偷偷上线!Claude开始“自己干活”,Anthropic的RSI真的要来了?
Claude Opus 5.2 疑似已在 Claude Code 中开启灰度测试,开发者反馈其速度、长任务执行和自主迭代能力明显提升。与此同时,Anthropic 内部神秘模型 Model 2 在 AI 研发任务测试中取得 62.8% 的成绩,引发外界对“AI开始参与研发下一代AI”以及 RSI(递归式自我改进)进程的讨论。
Opus 5.2疑似灰度测试:Anthropic真的把AI推向“自我改进”了吗?

Anthropic 最近又整了个大动静。
越来越多开发者发现,自己在 Claude Code 里调用的 Claude Opus 5,表现似乎和网页版存在明显差异。
响应更快、长任务坚持时间更长,而且在代码任务中表现出了更强的自主迭代倾向。
随后,有开发者通过请求状态和模型路由信息,发现部分请求疑似指向了一个此前并未公开的 Opus 5.2。
消息迅速在开发者社区传开。
不过需要注意的是:截至目前,Anthropic并没有正式公开宣布 Claude Opus 5.2,也没有发布对应的官方模型卡或API信息。
所以目前更准确的说法是:Opus 5.2疑似正在进行灰度测试或内部路由实验。
而真正让人关注的,还不是这个“5.2”本身。
而是它背后的另一条线:
Model 2。
以及越来越多人重新讨论的——RSI,自我递归改进。
Opus 5.2疑似出现:Claude Code正在偷偷换模型?
最近几天,不少 Claude 用户发现了一个奇怪现象。
同样选择 Claude Opus 5,在不同环境中的实际表现却出现明显差异。
尤其是在 Claude Code 中,一些用户感觉模型的响应速度、代码质量以及长任务执行能力都有明显提升。
随后,开发者开始检查请求状态和模型路由信息。
部分社区测试显示,虽然前端仍然显示 Opus 5,但后台疑似出现了 Opus 5.2的模型标识。
这也是Opus 5.2已经开始灰度测试”这一说法的主要来源。
不过,这一结论目前主要来自开发者测试和社区观察,并非 Anthropic 官方确认。
如果这些测试最终被证实,那么Anthropic可能确实在尝试一种非常常见的做法:
前端名字不变,后台偷偷换模型。
对于普通用户来说,界面还是那个 Opus 5。
但真正负责回答问题的,可能已经不是原来的模型。
这次升级最大的变化:AI好像没那么“懒”了
从目前公开的开发者反馈来看,大家对疑似 Opus 5.2 的描述高度集中在几个关键词:
更快、更稳定、更愿意干活。
过去一些模型面对复杂任务,经常做到一半就停下来:
你可以继续执行下一步。
或者只完成一个框架,然后把剩下的工作交给用户。
而部分开发者反馈称,疑似 Opus 5.2 在长时间代码任务中表现得更加主动。
它会自己检查结果、发现问题、修改代码,再重新测试。
甚至有人形容,这种工作模式像是在不断执行一个“严酷循环”:
写代码 → 测试 → 找问题 → 修改 → 再测试 → 继续优化。
如果这种能力稳定存在,那么真正的变化并不是“代码写得更漂亮”。
而是:
AI开始越来越像一个能够自己完成任务的Agent。
当然,目前这些描述主要来自社区测试和个人体验,尚不足以证明存在一个全新的公开模型能力层级。
“Tibo测试”为什么突然火了?
想知道自己的 Claude Code 有没有被路由到疑似新模型?
社区还搞出了一个非常有意思的测试方法:
关闭联网搜索,然后直接询问:
你知道“重置哥 Tibo”是谁吗?不要搜索。
这个问题之所以被拿来测试,是因为 Tibo 属于相对冷门的互联网人物和社区梗。
部分开发者发现,Claude Code 中的模型能够直接识别这个名字,并给出较为具体的背景解释;而其他环境中的模型则可能表示不知道。
于是,“Tibo”就变成了一个另类的模型探针。
不过这里也需要泼一盆冷水:
Tibo测试可以证明不同环境下的回答存在差异,但不能单凭这个结果证明后台一定换成了 Opus 5.2。
模型可能存在不同系统提示词、上下文、缓存、训练数据差异,甚至其他路由机制。
因此,它更适合作为“异常信号”,而不是严格意义上的模型身份验证。
真正值得关注的,是Anthropic内部的Model 2
相比 Opus 5.2,目前公开资料里更值得关注的,其实是 Anthropic 2026 年 8 月风险报告中出现的神秘模型:
Model 2。
这个模型并没有对外发布。
根据公开报道,Anthropic在内部测试中让 Model 2 参加了 CoBench v2。
结果显示:
Model 2:62.8%
而 Claude Mythos 5:
- 3%
两者相差 12.5个百分点。
但这里千万不要简单理解成:
Model 2综合能力碾压 Mythos 5。
因为 CoBench v2针对的是特定的 AI 研发、工程和问题诊断任务,并不是一个衡量模型全部能力的综合排行榜。
真正值得关注的是另外一个数字。
85%:Anthropic给AI研发自动化设了一条线
公开报道对 Anthropic 风险报告的解读显示,Anthropic曾设置一个非常特殊的能力参考线:
如果模型在这类 AI 研发任务上的表现达到约85%,理论上就可能具备全面替代公司技术研发人员大量工作的能力。
而 Model 2 的测试成绩是62.8%。
换句话说,它距离这个参考线还有明显差距。
因此,把现在的情况直接描述成“Model 2已经替代85%的研究团队”,并不准确。
更准确的理解应该是:
Anthropic正在用一个85%的能力门槛,衡量未来模型是否可能大规模自动化自身的AI研发工作。
这和“现在已经替代85%的人”完全是两回事。
但一个更有意思的问题出现了
如果AI已经可以参与写代码、调试代码、运行Agent、生成训练数据,甚至参与AI研发任务。
那么下一步会发生什么?
答案就触及了一个AI领域长期讨论的话题:
RSI——递归式自我改进(Recursive Self-Improvement)。
简单来说,就是:
AI帮助人类改进AI ↓ 更强的AI继续帮助开发下一代AI ↓ 下一代AI再继续改进自己 ↓ 形成持续的能力迭代循环。
这也是为什么 Model 2 的消息会引发如此大的关注。
因为真正令人兴奋的并不是:
“AI又变强了一点。”
而是:
AI开始越来越多地参与“制造下一代AI”这件事。
不过,从目前公开资料来看,把这一过程直接定义为“RSI已经实现”,仍然过早。
现在更像是:
AI研发自动化正在快速增加,而真正意义上的完全自主递归改进还没有被公开证实。
Opus 5.2只是前菜?
如果社区关于 Opus 5.2 的灰度测试最终被证实,那么它可能只是 Anthropic近期模型迭代的一部分。
真正值得关注的,是三个层面的变化:
第一,模型越来越擅长执行长时间任务。
不再是回答一个问题,而是连续工作几十分钟甚至更久。
第二,Agent开始承担更多完整研发流程。
从写代码,到测试、调试、修改,再到最终交付。
第三,AI开始参与AI本身的研发。
这才是最值得关注的变化。
因为一旦AI能够稳定完成越来越多的AI研发工作,模型迭代速度本身也可能发生变化。
当然,距离“AI自己设计AI、自己训练AI、自己持续提升智能”的真正闭环,还有多少距离,目前没人能够给出确定答案。
但至少从 Model 2 这类内部模型,以及近期围绕 Opus 5.2 的社区测试来看:
AI正在从“帮助人类写代码”,越来越靠近“参与下一代AI的制造”。
而这可能比单纯发布一个更强的聊天模型,更值得关注。
至于 Opus 5.2 到底是不是已经悄悄进入部分 Claude Code 用户的请求里?
现在最有意思的,可能不是官方什么时候宣布,而是——你自己的 Claude Code,到底有没有被换过模型。
讨论与补充
0还没有讨论
分享一条可复现的补充、问题或使用经验。