开发者近日排查发现,Claude Code自2.1.237版本起出现推理能力异常下降现象。经核对API请求日志确认,后台将用户选择的high推理程度错误映射为数值10,该数值实际对应过往low档配置,导致模型输出质量显著下滑。

事件影响

此次变更属于Anthropic未公开说明的A/B测试实验,涉及将Fable 5会话纳入压缩effort刻度调整。事件曝光后大量开发者反映排查耗时增加,社区对黑盒更新机制表示强烈质疑。

Anthropic工程师回应称该实验仅为服务配置测试,修改的是数值映射方式而非实际性能参数。同时承认Opus 5存在性能波动问题,并将其列为最高优先级修复事项。

此次风波折射出大模型服务在持续迭代中面临的透明度困境——底层路由、量化方案与推理资源的动态调整往往缺乏同步告知渠道。