AI Daily Digest — 2026年10月1日

本日のAI業界注目ニュースを 27件 厳選してお届けします。

TOP 3

モデル

GPT-6.1 Sol(Max)、1759点でCode Arena: WebDevの3位に

Arenaの評価ランキングによると、OpenAIのGPT-6.1 Sol(Max)は1759点でCode Arena: WebDevの3位に入った。混合価格は100万トークンあたり8ドル。GPT-6 Sol(Max)から同価格で70点向上して順位を4つ上げ、Consumer Productなど全カテゴリでスコアが伸びた。

Ant Ling、現実世界の長時間タスク向けに強化したLing-3.1-flashを発表

Ant Ling(螞蟻百霊)がLing-3.1-flashを発表した。総パラメータ数は約560B、トークンあたりの活性化パラメータは約25B、コンテキストウィンドウは最大1M。ハイブリッド線形アーキテクチャを継承しつつ線形Attention層の比率を高めた(KDA 7層に対しGated MLA 1層、512のルーティングエキスパートから8つを選択し共有エキスパート1つを追加)。

プロダクト

Arena、Claude Sonnet 5.5を期間限定で開放、Direct Modeで48時間利用可能

ArenaはAnthropicのClaude Sonnet 5.5(High)をDirect Modeで期間限定開放すると発表した。期限は10月2日午前8時(太平洋時間)で、以降もBattleとAgent Modeでは利用できる。引用された説明によると、Claude Sonnet 5.5はClaude 5.5シリーズの2番目のモデルで、Sonnet 5より30%以上高速、大半の作業でコストが最大30%下がる。

Perplexity、Computerへのメール委任を全員に開放、期間限定でタスクを無料実行

PerplexityはComputerのメール委任機能を全員に開放した。Perplexityアカウントは不要で、computer@perplexity.com宛てに転送またはCCしたタスクを期間限定で無料実行する。エージェントはバックグラウンドでタスクを完了しメールの文脈を保持する。各メールタスクはComputer内で通常のセッションとして動作し、Webとモバイルで確認でき、アプリ内タスクと同じ監査記録が付く。

Artificial Analysis、AA-AgentPerf-Localをオープンソース化、ノートPCとワークステーションでのローカルAIエージェント推論性能を測定

Artificial AnalysisがオープンソースツールAA-AgentPerf-Localを公開した。8つの実際のエージェントタスク(168ターン、コンテキストは約56Kトークンまで増加)を再生してローカル推論性能を測定する。ノートPCとワークステーションのランキングも公開した。

業界

Trump氏、20社超のテック企業による自主的なAI安全協定への署名を推進

約20社超のテック企業がホワイトハウスの超知能協定に署名し、独立した安全監査の実施、定期協議、共通の安全基準の策定を約束した。対象はサイバーセキュリティ、バイオセキュリティ、化学的脅威などのリスクに及ぶ。協定に法的拘束力はなく、Trump氏は道義的な拘束力があると述べた。記事は、OpenAIの最近の複数の事故が今年5〜7月に開発中だった未公開モデルに起因すること、同社の安全委員会の実効性がデラウェア州とカリフォルニア州の司法長官による調査を受けていること、FTCもAIエージェントによる消費者被害の可能性について調査を始めたことを指摘している。

Hugging Face CEO、数千件のDMを受信、数日かけて一件ずつ対応へ

Clément Delangue氏は数千件のDMを受け取ったが、@botではDMを自動分析できないため、対応に数日かかると述べた。当面は特に適合する候補者にのみ注目するとし、返信がなくても否定的な評価を意味するわけではなく、具体的な職種にはHugging Faceの採用ページから応募できると案内した。

リサーチ

Anthropic、ロボットによる職務の代替可能性を試算:物理タスクの74%を実行できるがコスト競争力があるのは0.3%のみ

Anthropicが研究を公開した。Claudeを使って約19,000の業務タスクについてロボットによる代替可能性を評価した結果、現在のロボットは米国の物理タスクの74%(全労働時間の34%)を実行できるが、人手よりコスト競争力があるのは0.3%のタスクにとどまる。年約3%の価格低下が続く場合、10%に達するまで約40年かかる。

技術

OpenRouterチュートリアル:本番トラフィックからgolden評価セットを構築しモデル横断で再テストする方法

OpenRouterが、本番トラフィックからgolden評価セットを構築し、デプロイ前の回帰テストとして使う方法を解説するチュートリアルを公開した。5つのステップ(本番トラフィックのサンプリング、重複排除とクラスタリング、期待出力の追加、初回評価でのrubric修正、GitへのコミットとCI連携)を扱う。20〜50件のレビュー済みサンプルから始めて100〜1,000件の完全な回帰セットへ拡張し、合成データではなく実トラフィックを使って分布と失敗パターンを保つよう勧めている。

vLLMの分離型推論(Disaggregated Serving)実践ガイド

vLLM公式ブログが分離型推論の実践ガイドを公開した。vLLM v0.30.0以降におけるprefill/decodeの分離、GPU不要のrenderフロントエンド、および両者の組み合わせについて、仕組みと実行方法を解説している。