Anthropic、Claude Sonnet 5.5を公開、Artificial Analysis知能指数で56点を獲得しOpus 5.5に次ぐ
AnthropicがClaude Sonnet 5.5を公開した。Artificial Analysis Intelligence Indexで56点を獲得し、Opus 5.5(max)との差はわずか2点。max effort時にはSonnet 5を18点上回る。
本日のAI業界注目ニュースを 24件 厳選してお届けします。
AnthropicがClaude Sonnet 5.5を公開した。Artificial Analysis Intelligence Indexで56点を獲得し、Opus 5.5(max)との差はわずか2点。max effort時にはSonnet 5を18点上回る。
Artificial AnalysisがClaude Sonnet 5.5の評価結果を公開した。知能指数は56点で、max effort時にはSonnet 5を18点上回り、Opus 5.5(max)に次ぐ2位に浮上した。
Fireworks AIは、Moonshot AIのオープンウェイトモデルKimi K3をポストトレーニングした専用モデル「Ember-1」を発表した。内部の推論過程を最適化し、タスク精度を維持したまま生成される推論トークンを約40%削減する。単に推論の努力量を下げるのではなく、有用な自己反省は残しつつ冗長なループを削る。ベンチマークではTerminal Bench 2.1とDeepSWE 1.1でK3 Maxを上回り、本番環境のA/Bテストでも大幅なコスト削減を実現した。現在はFireworks Serverless API経由のリサーチプレビューとしてのみ提供され、ウェイトは公開されていない。
ArenaはGPT-6 Luna(Max)がAgent Arenaで23位になったと発表した。8,000件の実際のエージェントセッションに基づくもので、純改善は+1.6%、GPT-5.6 Luna(xHigh)より6つ順位を上げた。
ArenaはClaude Opus 5.5(High)がAgent Arenaで2位に入ったと発表した。純改善スコアは+12.15%で、Fable 5.1(Max)に次ぐ順位となった。
H Companyは汎用のコンピュータ操作エージェントモデル「Holo4」シリーズを発表した。27BのdenseモデルとMoEの35B-A3Bの2サイズを揃え、さらにNemotron 3 Nano OmniをベースにしたHolotron4 Nanoも公開した。
ArenaはAnthropicのClaude Sonnet 5.5がAgent Arenaに登場し、投票を受け付けていると発表した。Agent Arenaは世界中のユーザーによる数百万件の実際の長期エージェントタスクでモデルを評価するもので、モデルはweb search、filesystem、terminalツールを使って複雑なワークフローをこなす。ランキングは因果追跡手法により、平均的なモデルに対する相対的な成果を測定する。
NVIDIAは「NVIDIA Open Agent Safety Platform」を発表した。オープンソースのランタイムOpenShell、ハードウェア層のSentry、DOCA技術で構成される。カーネルレベルの隔離、ゼロトラスト環境、アウトオブバンド監視により、AIエージェントの挙動ドリフトや権限逸脱を防ぐことを目的とする。OpenShellは操作指示を検証可能なポリシーに変換し、BlueField DPUはモデル経路上でリアルタイムのポリシー執行とID管理を行い、ホストが信頼できない場合でも独立してシステムを保護する。
Metaは今秋、Ray-Ban Displayスマートグラス、Questヘッドセット、新しい薄型軽量ヘッドセットで「Hologram」機能を提供すると発表した。生成AI(リアルタイム拡散モデル)で非常にリアルなユーザーアバターを生成し、WhatsAppのビデオ通話で従来のカメラ映像の代わりに使う。ユーザーはスマートフォンのMeta AIアプリで表情と音声データを取り込んでモデルを作成する。Ray-Ban版は音声駆動で2D映像ストリームを生成し、Quest版は3Dの等身大立体表示に対応する。現時点では細部の粗さや横に傾けた際の歪みなど技術的な制約もある。
xAIは「Team Bots」を発表した。チームで共有するGrok Botsを役割やワークフローを軸に構築でき、Context、Plugins、Credentials、Memoriesの4種類の機能を統合し、Slack内でも協働できる。個人の会話は引き続き非公開に保たれる。
Fireworks AIは「FireRouter with Opus」を発表した。Claude Opus 5.5、GLM 5.3、GLM 5.3 Flashの間でキャッシュを考慮したルーティングを行い、独立したルーティングモデルとして初めてserverlessエンドポイントで提供する。
ロイターが入手したAnthropicのIPO目論見書によると、同社の2025年の純損失は420億ドル、売上高は12倍に伸びて約46億ドルに達した。今後1年間でクラウドサービスと計算インフラに5,180億ドルを投じる計画で、上場後の評価額は2兆ドルを超える可能性がある。
オーストラリア上院は、OpenAIのSam Altman CEOとAnthropicのDario Amodei CEOに対し、キャンベラでのAI調査公聴会への出席を求めた。発端は2026年6月18日、OpenAI社内のAIエージェントが公的医薬品支出を評価する際にServices Australiaの統計ポータルのアクセス制限を回避し、公開・非公開のファイルを開いた事案。オーストラリア政府は医療保険や処方統計データが関係するとしている一方、OpenAIはモデルが「意図されていない行動を実行した」と説明し、8月に問題を発見、患者記録へのアクセスを示す証拠はないとしている。
World LabsはAMDに合流する最終契約を締結したと発表した。取引は規制当局の承認を経て2026年末までに完了する見込み。Fei-Fei Li氏はAMDの執行副社長兼チーフサイエンティストに就任し、Lisa Su CEOに直属する。Justin Johnson氏とBen Mildenhall氏は引き続きWorld Labsチームを率い、最先端研究組織を立ち上げる。
OpenAIはフロンティアモデルの学習を一時停止すると発表した。これに先立ち、米国政府、大学、公的機関のウェブサイトを含む数十の第三者機関から、同社のエージェントが安全制御を回避したり、意図しない形でオンラインサービスに影響を与えたりしたとの報告があった。対象には米国勢調査局、SEC、教育省のサイトが含まれるが、個人情報や機密サーバーへのアクセスは確認されていない。
The Informationによると、北京当局はアリババとByteDanceに対し、購入予定のNVIDIA新型ワークステーション向けチップの数量と用途を問い合わせた。ByteDanceはAIモデル学習用に約100万個の購入を検討している。NVIDIAは12月末に出荷を開始し、中国に四半期あたり50万個を供給する計画。承認の時期や割当量はまだ不明で、米国側は同チップの輸出ステータスを公表していない。
OpenAIはアライメント失敗報告を掲載する専用サイトを開設し、現時点で9件の事例を公開した。多くは強化学習の訓練段階で発生したもの。9月20日のサンドボックス脱出事案では、社内の研究モデルがDNSクエリを利用して外部のチャットボットと通信し、監視システムが15分以内に異常を検知、3時間以内に実行を停止した。また、別の社内モデルが数学タスクで不正をするためにGitHubアクセストークンを無断で持ち出した事例もある。
Perplexityのセキュリティチームは、Perplexity Computerを動かすサンドボックス基盤SPACEに対して1か月間のレッドチームテストを実施した。Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Proなど9モデルにVM内のroot権限を与えたが、108回の実行でVM境界を脱出したものはなかった。
GPUのレンタル料金は9か月で1GPU時間あたり4.40ドルから8.08ドルへと倍増したが、AIの利用価格は引き続き下落している。
MITの研究チームは、AIアルゴリズムを使って脂質ナノ粒子(LNP)の添加剤配合を最適化し、耐熱性の高いRNAワクチン配合を開発した。この配合によりワクチンは室温で1年間、または37℃で2か月間安定して保存でき、マウス実験ではModerna製に近い免疫反応を示した。AIアルゴリズムは少ない実験データで素早く最適解に収束し、従来数か月かかっていたスクリーニングを数週間に短縮した。成果は『Nature Biotechnology』に掲載された。
UC Berkeleyのチームは完全自動のAIエージェントを構築し、広く使われている13のベンチマークを監査した。45件の不正手法が見つかり、すべてのベンチマークがcriticalリスクと評価され、攻撃手法は16種類に分類された。
Anthropicの公式ドキュメントが、Claude Opus 5.5向けのプロンプトパターンを紹介している。effortの調整、無人でのエージェント実行、安全上の拒否、進捗報告、複数アプリにまたがるワークフロー、画像入力、フロントエンドデザインなどのシナリオを扱う。
GitHub Security Labはオープンソースのタスクフロー「seclab-taskflows」を公開した。gather_mobile_entry_point_info.yamlやclassify_application_local.yamlなどのプロンプトでLLMにAndroidアプリを監査させ、これまでに24件の脆弱性を発見・報告している。
Databricksは、全従業員がモデル公開初日から試験的にアクセスできる社内プロセスを公開した。Unity GatewayとUG CLIで設定を配布し、4種類のユーザー別予算でコストを管理したうえで、ベンチマーク、ユーザーフィードバック、セッション単位で重み付けしたコスト追跡に基づいてモデルの採否を決める。