AnthropicがClaude Opus 5を公開、性能を大幅に高めつつ価格を半減
AnthropicはClaude Opus 5を発表した。知能水準はClaude Fable 5に近づきながら価格を半分に抑えたとしている。Frontier-Bench v0.1ではOpus 4.8の2倍超の性能を示し、ARC-AGI 3では次点モデルの3倍のスコアを記録した。Opus 5は即日Claude Maxのデフォルトモデルとなり、Claude Proで利用できる最上位モデルにも位置づけられる。
本日のAI業界注目ニュースを 18件 厳選してお届けします。
AnthropicはClaude Opus 5を発表した。知能水準はClaude Fable 5に近づきながら価格を半分に抑えたとしている。Frontier-Bench v0.1ではOpus 4.8の2倍超の性能を示し、ARC-AGI 3では次点モデルの3倍のスコアを記録した。Opus 5は即日Claude Maxのデフォルトモデルとなり、Claude Proで利用できる最上位モデルにも位置づけられる。
Ant Bailingは新世代のネイティブ混合推論モデルLing-3.0-flashを公開した。総パラメータ数は124B、活性化パラメータは5.1Bに抑えられ、従来型推論、指示追従、長文処理などで前世代の旗艦Ring-2.6-1Tに匹敵または上回るとする。ネイティブ混合線形注意力アーキテクチャと1/64疎MoEを採用し、1万超の対話型訓練環境へ拡張したことで、長入力時のTTFTを60%から80%以上削減した。
Black Forest Labsは、画像、動画、音声を共同学習する多モーダル基盤モデルFLUX 3を発表した。訓練計算量の95%以上を動画予測に投じ、ロボット企業mimicとの協業でFLUX-mimicを開発し、Audiの生産ラインでテスト導入した。動作予測を加えた当初は動画生成品質が最大10%低下したが、3500ステップの訓練後には元の水準まで回復したという。
Midjourneyは画像モデルV8.2を公開した。美的品質、画像の創造性、パーソナライズ表現の向上に重点を置き、低品質画像の出現頻度を大きく下げるとしている。パーソナライズ機能はユーザーの美的嗜好をより正確に理解し、V8.2向けのプロファイルはより大きく質の高い画像選択プールを備える。
Black Forest Labsは、FLUX 3多モーダル基盤モデルをEarly Accessとして公開した。統一アーキテクチャで画像、動画、音声を共同学習し、Self-Flow学習フレームワークを拡張している。1回の生成で最長20秒の動画とネイティブ音声を出力でき、テキストから動画、画像から動画、複数ショット連結などのタスクを支援する。
RunwayはRunway Agentにワークフロー機能を導入した。ユーザーは自然言語でノードベースのワークフローを構築、実行、編集できる。ワークフローにより高品質な出力を大規模に生成しやすくなり、Runway内で「/ Workflow」スキルとして呼び出せる。
百度DaziはAI Dayで複数のアップデートを発表した。PCとスマートフォンの双方向連携により、タスクの文脈と進捗を同期し、複雑な作業を端末間で引き継げる。デスクトップ版には内蔵ブラウザが追加され、調査やダウンロードのために複数ページを自動で開ける。スマートフォン側はクラウド遠隔操作に対応し、智能ルーティングにより平均タスク時間を20%短縮、Token利用率を25%高めたとしている。
OpenRouterはClassifiersのベータ版を公開した。ユーザーは最大8軸の独自分類法を設定し、各AIリクエストのタスク種別、部門帰属、コンプライアンス分類などを自動タグ付けできる。分類は非同期に動作するため推論遅延を増やさず、サンプリング率でコストを制御できる。結果はログに書き込まれ、Activity Explorerでモデル利用やコスト配分を集計できる。
Claude Code v2.1.219では、Claude Opus 5がデフォルトのOpusモデルとして追加された。1Mコンテキストウィンドウに対応し、快速モードの価格は100万tokenあたり入力10ドル、出力50ドルとされる。ネスト型サブAgentの利用も支援する。
Nvidia、Microsoft、Metaは公開書簡に共同署名し、開放重みAIモデルへの過度な規制は米国のAI競争力を弱めると警告した。書簡は、開放重みモデルがイノベーションを促進し、参入障壁を下げ、学術研究を支えると主張している。OpenAIとAnthropicは署名していない。
MicrosoftのSatya Nadella氏は、健全なAIエコシステムには開放重みモデルが重要だと述べた。同社は業界各社とともに、国家安全保障を守りながら開放重みモデルを活用し、米国の競争力と経済機会を広げるための道筋を設計しているという。
英国AI安全研究所と米国AI標準・イノベーションセンターの共同評価によると、Moonshot AIのKimi K3はExploitBenchで32.2%にとどまり、米国の先行モデルの76.2%を大きく下回った。一方で智譜GLM-5.2の24.4%は上回っている。報告は、知識蒸留が性能差の一因である可能性にも触れている。
AnthropicとAndon Labsは、AIモデルが屋内環境で四ロータードローンを自律操縦し、指定人物を定位・追跡する能力を測るDrone-Benchを公開した。タスクは3D地図再構築、定位、ナビゲーション、対象検出、追跡の5つに分解され、ソフトウェア再現で迅速に評価できる。実験は、このタスク列がモデルの知能水準差を区別でき、物理世界でのAI制御能力の進展を示すとする。
Appleの研究は、大規模言語モデルが長期実行で高レベル戦略を持っていても不安定になり、細かく分解しすぎると少数の難しいステップで継続的な誤りが不可逆になる「不可回復ボトルネック」が生じると指摘した。Lookahead-Enhanced Atomic Decomposition(LEAD)は、短期的な未来検証と集約を導入してこの問題を緩和する。手法は制御されたアルゴリズムパズルで有効性が検証された。
Claude-thermosはローカルのリバースプロキシでClaude Codeの会話を監視し、メインAgentがサブAgent待ちで5分以上アイドルになると、プロンプトキャッシュを温めるリクエストを自動送信する。約185回のローカル会話で、キャッシュ失効による再エンコードが請求額の約22%を占めたという。uvxで実行でき、アイドル閾値や予熱間隔を設定できる。
AnthropicはClaude Opus 5やClaude Fable 5などの新世代モデル向けに、Claude Codeのシステムプロンプトを80%以上削減したと説明した。削減後もコーディング評価で顕著な性能低下は見られず、モデル側の能力向上に合わせたコンテキスト設計の新しいルールを示している。
AnthropicのプロダクトデザイナーNate Parrott氏は、Claude Designベータ版でHTMLインタラクションを使い、プロダクトプロトタイプ、スライド、アニメーションなどの視覚アイデアを探索・反復する方法を紹介した。Anthropicのブランドガイドラインをプロンプト化し、出力を自動的にブランドに沿わせる。Claude Designは画像モデルを含まないためロゴ設計には向かないが、Claude Codeと連携して初期アイデアを実装へつなげられる。
AnthropicはClaudeモデルの選び方を解説するガイドを公開した。モデルファミリーをMythos/Fable、Opus、Sonnet、Haikuの4系統に整理し、Mythos/Fableは最先端コーディングやAgentタスク、Opusは推論集約型の企業タスク、Sonnetは日常の汎用タスク、Haikuは低コストかつ高速な用途に向くとしている。