Sonnet 5.5
Anthropic が
コメントの要約
Anthropic が
コメントでは、Terminal-Bench で 70.6%(Opus 5.5 は 66.4%)、FrontierCode や CursorBench でも Opus 5.5 と 2 ポイント前後の差で、エージェント型コーディングではほぼ互角だという比較が出ている。Cyber Verification Program に参加していても許可済みのバグバウンティ作業が止められるという不満や、ベンチマークに Fable の数値がないという指摘もある。
OpenAI とコストのグラフで抜きつ抜かれつしているという見方や、5.0 以降は社内のコードベースの品質が落ちたため評価期間を長く取るという報告も出ている。