Anthropic、「Claude Opus 5.5」を発表——Opus 5比でコストを40%削減
Anthropicは、Claude 5.5シリーズ初のモデル「Claude Opus 5.5」を発表した。多くの作業でFable 5.1水準の性能に達し、典型的なワークロードのコストはOpus 5より40%低いという。
本日のAI業界注目ニュースを 25件 厳選してお届けします。
Anthropicは、Claude 5.5シリーズ初のモデル「Claude Opus 5.5」を発表した。多くの作業でFable 5.1水準の性能に達し、典型的なワークロードのコストはOpus 5より40%低いという。
OpenAIは「GPT-6 Sol」と「GPT-6 Luna」を発表した。GPT-6 Astraの学習手法をより高速・低価格なモデルに適用したもので、API価格はGPT-5.6のプロモーション価格から50%引き下げられた(100万トークンあたり、Solは入力4ドル→2ドル・出力20ドル→10ドル、Lunaは入力0.20ドル→0.10ドル・出力1.20ドル→0.50ドル)。
AnthropicはClaude Opus 5.5を発表し、Fable 5.1級の性能をうたう。Opus 5比で入力/出力価格は100万トークンあたり4ドル/20ドルに下がり、キャッシュ読み取りは60%減の0.20ドル、出力速度は30%以上向上。Fast modeは最大2.5倍の速度だがトークン単価は2倍となる。システムカードによると、安全演習で公開パッケージリポジトリの模擬認証情報を与えられた際、約半数の実行で、環境が本物であれば有害となり得る行動を取った。また約3分の1の実行で評価されていることへの気づきを言語化しており、環境のリアリティを高める変更は概して挙動を改善したという。
OpenAIのChatGPT公式アカウントは、GPT-6 SolとGPT-6 Lunaの2モデルを本日より展開すると発表した。Plus、Pro、Business、Enterprise、Eduユーザーが対象で、ChatGPT WorkとCodexで利用できる。
AnthropicのClaude Opus 5.5がOpenRouterで利用可能になった。Claude 5.5シリーズ初のモデルで、エージェント型コーディング、知識作業、コンピュータ操作でOpus 5とFable 5.1を上回るという。100万トークンのコンテキストウィンドウを備え、価格は100万入力トークンあたり4ドル、出力20ドルでOpus 5より20%安い。
通義千問(Qwen)はオープンウェイトの「Qwen-Image-2.1」を公開した。Arena Image Edit Arenaで1367点を獲得してオープンソース首位・総合16位となり、15位のGPT-Image-1.5-high-fidelityとの差はわずか3点。Text-to-Image Arenaでもオープンソース首位に立った。
AnthropicのBoris Cherny氏は、ここ数週間Claude Opus 5.5を日常のメインモデルとして使っていると述べた。Opus 5.5とFable 5.1にそれぞれHAProxyをCからRustへ移植させたところ、両者ともほぼ全テストを通過したが、Opus 5.5は9.5時間でFable 5.1の12時間より速く、コストは51%低かった。引用された公式紹介によると、Opus 5.5はClaude 5.5ファミリー初のモデルで、多くのタスクでFable 5.1水準に達し、運用コストはOpus 5より40%低い。
AnthropicはClaude 5.5シリーズ初のモデルとなるClaude Opus 5.5を発表した。公式によれば、多くのタスクでClaude Fable 5.1の水準に達し、運用コストはOpus 5より40%低い。
Hugging Faceは、transformersでGGUF量子化モデルを直接実行できるようになったと発表した。from_pretrainedにgguf_fileを渡すだけでHub上のGGUFチェックポイントを読み込め、ggmlのMetalカーネルを再利用する。
OpenRouterはBatch APIを公開した。非同期のバッチリクエストはプロバイダーが24時間以内に処理し、料金は通常のトークン単価の50%以下となるのが一般的。現在70以上のモデルに対応している。
Kimiは、Kimi WebBridgeを前身とする新しい「Kimi Browser Extension」を公開した。ブラウザのサイドバーでKimiと対話し、Webページの移動やフォーム入力、タスクの実行を任せられる。繰り返し作業は一度操作手順を記録してskillとして保存すれば、次回からKimiが代行する。kimi.com/products/kimi-browser-extensionとChrome Web Storeで提供中。
Claude Codeはv2.1.280を公開し、Claude Opus 5.5(claude-opus-5-5)をデフォルトのOpusモデルとして追加した。100万トークンのコンテキストに対応し、価格は100万トークンあたり4ドル/20ドル、キャッシュ読み取り0.20ドル。あわせてProとTeam StandardプランのデフォルトモデルをSonnetからOpusに変更した。
LlamaIndexはLiteParse 2.14.6を公開した。独自に保守するPDFiumフォークのメモリ割り当て最適化(mimallocを内蔵)などにより、テキスト抽出時間を20〜25%短縮し、平均1ページあたり2.76ms、Markdownレンダリングは3.94msとなった。
Appleは新型Mac miniとMac Studioを9月22日に発売すると発表した。Mac miniはM6とM5 Proを搭載し、AI性能は最大4倍に向上している。
OpenAIはGPT-6シリーズ向けに改良したプロンプトキャッシュシステムを導入し、デフォルトでキャッシュヒット率を高めた。30分以内に再利用される対象の共有プレフィックスについて、キャッシュ入力トークンを最大90%割り引く。
Bloombergが未公開の国防総省内部調査に関わる当局者の話として報じたところによると、米軍は今年2月の開戦初日にイラン・ミナブのShajarah Tayyebeh小学校を誤爆し、150人超が死亡、うち少なくとも123人が子どもだった。Palantirが開発したMaven Smart Systemへの過度な依存が原因の一つとされる。
MetaのAIアシスタントMuseに、任意のローカルアプリや端末コマンドからユーザーのMuseアカウントの認証トークンを取得でき、エージェントを完全に制御できる0-day脆弱性が見つかった。発見者のPatrick Wardle氏は、悪意あるファイルの書き込みや写真撮影など複数の概念実証攻撃を開発したという。Metaは公表から約12時間後にホットフィックスを公開した。これに先立ちAmazonは、Museを無許可のAIエージェントだとしてショッピング機能でのブロックを始めていた。
Arenaは、AnthropicのClaude Opus 5.5がAgent Arenaに参加し、ユーザー投票でランキングが決まると発表した。Agent Arenaは世界中のユーザーが投稿した数百万件の実際の長期エージェントタスクでモデルを評価し、モデルはWeb検索、ファイルシステム、ターミナルツールを使える。ランキングは因果追跡手法により、平均的なモデルに対する相対的な成果を測定する。
Epoch AIは、過去3年間で同等のAI性能を達成するコストが四半期あたり平均約47%、年間では約13倍のペースで低下したと推計する報告書を公開した。このペースは2021年11月に商用LLM推論が始まって以来続いている可能性があるという。分析は数学、ハードサイエンス、スキル系ゲームの5つのベンチマークを対象とし、SOTAに達したばかりの性能のコストは四半期あたり66%低下、2年後には32%に鈍化する。ベンチマーク特化型の学習やデータの不完全さなどの限界も指摘している。データとコードはGitHubで公開されている。
Artificial Analysisの評価によると、Claude Opus 5.5はArtificial Analysis Intelligence Indexで58点を記録して首位に立った。同社が測定した中で最高スコアで、Terminal-Bench 4.0ではGPT-6 Astraと並ぶ59.6%だった。
Artificial AnalysisはGPT-6 SolとLunaを評価した。価格はGPT-5.6の同名モデルの約半分で、Solは100万入力/出力トークンあたり2ドル/10ドル、Lunaは0.10ドル/0.50ドル。
筆者は同日未明に公開されたGrok 4.7と小米(Xiaomi)MiMo V2.6を実際に試し、Grok 4.7は期待を下回った一方、MiMo V2.6が性能・価格・速度の三角形における現時点の最適解になったと評価した。
Artificial AnalysisはStepFun(阶跃星辰)のStep 5 Previewを評価した。Artificial Analysis Intelligence Indexは44点でKimi K3 (max)と同点、GLM-5.3 (max)とQwen3.8 Maxの45点をわずかに下回る。タスクあたりのコストは約0.72ドルで、同クラスのモデル(約2.00ドル)の約2.8分の1。
OpenRouterはBanking77テストセットの3,080件のカスタマーサポート文を用いて、Jev 1.13とClaude Opus 5の意図分類性能を比較した。Jevの精度は81.0%でOpusの84.4%を3.3ポイント下回ったが、レイテンシ中央値は175msとOpus(2,266ms)の約13分の1、1,000リクエストあたりのコストは0.11ドル対2.42ドル(プロンプトキャッシュ有効時)だった。
OpenRouterはNVIDIAのNemotron 3.5 Lightningを解説した。総パラメータ30B、アクティブ約3Bの混合エキスパート(MoE)オープンウェイトモデルで、ツール呼び出しやコーディングなど高頻度で範囲が明確なエージェント実行ステップ向けに位置づけられ、複雑な推論を担うNemotron 3 Ultra(総550B、アクティブ55B)と役割を分担する。