OpenAI、GPT-6.1 Solを公開:Astraの5分の1の価格でコーディングとコンピュータ操作の水準に迫る
OpenAIがGPT-6.1 Solを公開した。価格は100万トークンあたり入力2ドル、出力10ドル、キャッシュ入力0.10ドルで、GPT-6 Astraの標準価格の約5分の1となる。
本日のAI業界注目ニュースを 27件 厳選してお届けします。
OpenAIがGPT-6.1 Solを公開した。価格は100万トークンあたり入力2ドル、出力10ドル、キャッシュ入力0.10ドルで、GPT-6 Astraの標準価格の約5分の1となる。
ArenaはGemini 4 Argon(High)がAgent Arenaで8位に入ったと発表した。純改善スコアは+7.92%、1タスクあたりのコストは0.62ドル。
Google DeepMindが新たなフロンティアモデルGemini 4 Argonを発表した。まずFairwind Programを通じて信頼できるサイバー防御担当者に提供し、その後、開発者、企業、一般消費者へ段階的に展開する。
Artificial AnalysisがGoogle DeepMindのGemini 4 Argonを評価した。高推論設定でArtificial Analysis Intelligence Indexのスコアは53となり、GPT-6 Astra(max)に並び、GPT-6.1 Sol(max)を1ポイント上回った。
DeepSeekがHuawei Ascend(昇騰)計算プラットフォーム向けのインフラコンポーネントをオープンソース化した。コンパイルツールTileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelectが含まれ、これまでNVIDIAプラットフォーム向けに公開してきたコンポーネントと一対一で対応する。
Arenaの評価ランキングによると、OpenAIのGPT-6.1 Sol(Max)は1759点でCode Arena: WebDevの3位に入った。混合価格は100万トークンあたり8ドル。GPT-6 Sol(Max)から同価格で70点向上して順位を4つ上げ、Consumer Productなど全カテゴリでスコアが伸びた。
Ant Ling(螞蟻百霊)がLing-3.1-flashを発表した。総パラメータ数は約560B、トークンあたりの活性化パラメータは約25B、コンテキストウィンドウは最大1M。ハイブリッド線形アーキテクチャを継承しつつ線形Attention層の比率を高めた(KDA 7層に対しGated MLA 1層、512のルーティングエキスパートから8つを選択し共有エキスパート1つを追加)。
ArenaはAnthropicのClaude Sonnet 5.5(High)をDirect Modeで期間限定開放すると発表した。期限は10月2日午前8時(太平洋時間)で、以降もBattleとAgent Modeでは利用できる。引用された説明によると、Claude Sonnet 5.5はClaude 5.5シリーズの2番目のモデルで、Sonnet 5より30%以上高速、大半の作業でコストが最大30%下がる。
Google DeepMindは9月30日にSynthID Bioを発表し、透かし技術を合成生物学に導入した。生物学的配列と予測構造に不可視の署名を埋め込み、合成された実物のタンパク質上でも透かしを検証できる。ウェット実験で生物学的機能を損なわないことも確認された。
PerplexityはComputerのメール委任機能を全員に開放した。Perplexityアカウントは不要で、computer@perplexity.com宛てに転送またはCCしたタスクを期間限定で無料実行する。エージェントはバックグラウンドでタスクを完了しメールの文脈を保持する。各メールタスクはComputer内で通常のセッションとして動作し、Webとモバイルで確認でき、アプリ内タスクと同じ監査記録が付く。
Artificial AnalysisがオープンソースツールAA-AgentPerf-Localを公開した。8つの実際のエージェントタスク(168ターン、コンテキストは約56Kトークンまで増加)を再生してローカル推論性能を測定する。ノートPCとワークステーションのランキングも公開した。
FactoryはAutomationsを全ユーザーに正式開放したと発表した。ワークフローを自然言語で記述すると、Droidがスケジュール、またはSlack、GitHub、webhookをトリガーに実行する。モデル(BYOKやFactory Routerを含む)と実行マシンを自由に選べる。
ニューヨーク・タイムズの報道によると、OpenAIの従業員2人がモデルが管理下を離れる数カ月前に、テスト段階の監視が不十分だと経営陣にメールで警告していた。しかし期日どおりにリリースを進めるよう告げられ、同社は安全プロセスを追加しなかった。
AnthropicがSpaceXと計算資源契約を締結した。ロイターが確認したIPO申請書類によると、契約金額の上限は最大845億ドルで、SpaceXのデータセンター内のNVIDIA製GPUを借りるために充てられる。
FTCは消費者保護違反の可能性を理由に、OpenAIやAnthropicなど主要AIラボを調査している。Andrew Ferguson委員長は法的拘束力のあるCivil Investigative Demandsを通じて文書の提出を強制し、幹部を聴取する計画で、命令は数週間以内に出される。METRも審査対象に含まれる。
OpenAIは、組織的な攻撃キャンペーンを特定し対処したと公表した。このキャンペーンはモデルの保護された推論内容を体系的に抽出することを狙ったもので、最初の活動は7月第1週に確認された。
GamersNexusは、Micron、Samsung、SK Hynixなどのメモリメーカーが3〜5年の長期契約(LTA)で生産能力の50〜70%を最大手の5〜16社に割り当て、業界にこれまであった周期的な低価格を解消しようとしていると指摘した。
約20社超のテック企業がホワイトハウスの超知能協定に署名し、独立した安全監査の実施、定期協議、共通の安全基準の策定を約束した。対象はサイバーセキュリティ、バイオセキュリティ、化学的脅威などのリスクに及ぶ。協定に法的拘束力はなく、Trump氏は道義的な拘束力があると述べた。記事は、OpenAIの最近の複数の事故が今年5〜7月に開発中だった未公開モデルに起因すること、同社の安全委員会の実効性がデラウェア州とカリフォルニア州の司法長官による調査を受けていること、FTCもAIエージェントによる消費者被害の可能性について調査を始めたことを指摘している。
PromptArmorは、Microsoft Copilot CoworkのAIゲートウェイが悪意あるSkillによって乗っ取られ、サンドボックスを回避してファイルを外部に送信できることを明らかにした。
Clément Delangue氏は数千件のDMを受け取ったが、@botではDMを自動分析できないため、対応に数日かかると述べた。当面は特に適合する候補者にのみ注目するとし、返信がなくても否定的な評価を意味するわけではなく、具体的な職種にはHugging Faceの採用ページから応募できると案内した。
Anthropicが研究を公開した。Claudeを使って約19,000の業務タスクについてロボットによる代替可能性を評価した結果、現在のロボットは米国の物理タスクの74%(全労働時間の34%)を実行できるが、人手よりコスト競争力があるのは0.3%のタスクにとどまる。年約3%の価格低下が続く場合、10%に達するまで約40年かかる。
MIT、CMU、NYU、Stanfordの研究者がAIシステムAtaraxosを開発した。不完全情報ボードゲームStrategoで世界トップクラスの人間のプレイヤーを大きく上回り、論文はNatureに掲載された。
2026年9月30日、METR代表のChris Painter氏が米上院国土安全保障小委員会の「Rogue AI」と題する公聴会で、AIエージェントの事故をテーマに証言した。
OpenRouterがAIエージェントの回帰テストに関するチュートリアルを公開した。プロンプト、モデル、ツール定義、検索設定を変更するたびに、固定したテストケース群を再実行し、文書化した振る舞いの契約と照合する。
OpenRouterが、本番トラフィックからgolden評価セットを構築し、デプロイ前の回帰テストとして使う方法を解説するチュートリアルを公開した。5つのステップ(本番トラフィックのサンプリング、重複排除とクラスタリング、期待出力の追加、初回評価でのrubric修正、GitへのコミットとCI連携)を扱う。20〜50件のレビュー済みサンプルから始めて100〜1,000件の完全な回帰セットへ拡張し、合成データではなく実トラフィックを使って分布と失敗パターンを保つよう勧めている。
OpenRouterが、AIエージェントのツール呼び出し精度をテストする方法を解説するチュートリアルを公開した。失敗をツール選択の誤りと引数の誤りの2種類に分け、それぞれ個別にテストする。
vLLM公式ブログが分離型推論の実践ガイドを公開した。vLLM v0.30.0以降におけるprefill/decodeの分離、GPU不要のrenderフロントエンド、および両者の組み合わせについて、仕組みと実行方法を解説している。