xAI、長時間エージェント能力を強化したGrok 4.6を公開
xAIはGrok 4.6を公開し、Grok 4.5から長時間稼働するエージェント能力、複雑な対話型作業、視覚タスクを重点的に強化した。複数のエージェント型コーディングや知識作業ベンチマークで前線水準に達し、Artificial Analysis Intelligence IndexではGPT-5.6 Solと同等の総合スコアを示したという。エージェント実行時間と作業範囲の拡大が、モデル競争の主要軸になっていることを示す更新である。
本日のAI業界注目ニュースを 20件 厳選してお届けします。
xAIはGrok 4.6を公開し、Grok 4.5から長時間稼働するエージェント能力、複雑な対話型作業、視覚タスクを重点的に強化した。複数のエージェント型コーディングや知識作業ベンチマークで前線水準に達し、Artificial Analysis Intelligence IndexではGPT-5.6 Solと同等の総合スコアを示したという。エージェント実行時間と作業範囲の拡大が、モデル競争の主要軸になっていることを示す更新である。
AlibabaのQwenチームは、Qwen3.8-2.4T-A95Bのモデル重みを公開した。Qwen-Max級モデルとして初のオープン化であり、総パラメータ2.4T、tokenごとの活性化パラメータ95B、ネイティブ262,144 tokenコンテキストに対応し、最大1,010,000 tokenまで拡張できる。巨大MoEモデルの重み公開は、研究、推論基盤、企業内カスタマイズの選択肢を大きく広げる動きである。
LTXはLTX-2.5を公開し、ComfyUIへネイティブ統合した。NVIDIA GB200を2枚使う構成では10秒の720p動画を6.8秒で生成でき、LTX-2.5 Fastは音声付き720p動画を1秒0.09ドル、10秒0.90ドルで生成できるという。動画生成が品質だけでなく速度、コスト、制作ツール統合で競争する段階へ進んでいる。
Microsoft AIは、初の推論モデルMAI-Thinking-1をゼロから構築し、Microsoft Foundryで提供開始した。Mustafa Suleyman氏が公開を明らかにしており、Microsoftが外部モデル活用だけでなく、自社の推論モデル開発を前面に出し始めた点が注目される。モデル供給、クラウド、製品統合を一体で進める競争がさらに強まる。
OpenRouterは、モデル、検索エンジン、検索方式、検索予算の組み合わせを評価するリアルタイムランキングを公開した。BrowseCompでは検索予算を1ラウンドから25ラウンドへ増やすとスコアがほぼ倍増し、コスト増は2.5から7倍にとどまったという。一方でモデル選択の平均スコア差は検索エンジン差より大きく、エージェント設計で検索深度とモデル選定を同時に最適化する必要性を示している。
AnthropicはClaude in Chrome拡張のサイドバーをClaude Coworkセッションへアップグレードした。会話は履歴へ保存され、スキルやコネクターがブラウザ内で動作し、タスクはデスクトップ、Web、モバイルアプリ間で継続できる。ブラウザ拡張が単なる補助UIから、継続的な作業セッションの入口へ変わりつつある。
SGLangとMilesは、Qwen3.8-2.4T-A95Bの公開初日に推論対応した。同モデルはQwen最大のオープンモデルで、総パラメータ2.4T、tokenごとの活性化パラメータ95B、混合注意力アーキテクチャを採用する。超大型オープンモデルを公開直後から実験・運用スタックに組み込めることは、モデル公開の実用価値を左右する。
WhatsAppは、潜在的な詐欺メッセージを検出する任意機能Scam Alertを構築した。エンドツーエンド暗号化を保ったまま機械学習モデルを端末上で実行し、メッセージ内容は端末外へ出ず、自動通報も行わない。モデル重みは独立検証のために公開され、テレメトリは差分プライバシーで集計される。大規模メッセージングでプライバシー、AI安全、検証可能性を両立させる重要な事例である。
Claude Code v2.1.229が公開され、リモート制御セッションの復元、自前runner向けサーバーサイドhook、プラグイン市場コマンド源が追加された。長い応答のストリーミング欠落、狭いターミナルでの描画クラッシュ、Windows拡張パスのクラッシュなども修正されている。コーディングエージェントの実運用では、機能追加と同じくらいセッション継続性や安全なコマンド承認が重要になっている。
医学研究者向けサイトResearch Goldは、サービスを「100%人間が執筆し、AIは一切使わない」と宣伝し、博士号を持つ査読者も掲載していた。しかし調査では、これらの査読者はAI生成で実在せず、一部の実在研究者の身元や写真も無断利用されていたと報じられた。AI利用の透明性、研究支援サービスの信頼性、本人確認の重要性を突きつける事例である。
RingCentralは全社員にChatGPT WorkとCodexを展開し、エンジニアリングから業務運営までAIネイティブな開発を進めている。AI-Native Challengeでは、非技術職を含む数千人の従業員が実行可能なプロジェクトを提出した。企業導入が個人の補助利用から、組織横断の業務変革へ移る流れを示している。
Google Researchは知識プロファイルの枠組みを提案し、Gemini3やGPT-5などの前線LLMでは事実の符号化が飽和に近い一方、リコール能力が不足していると分析した。多くの事実誤りは「棚が空」なのではなく「鍵をなくす」問題だという。2,150件のWikipedia事実と各10問を含むWikiProfileベンチマークも公開され、エンコード、リコール、認識を分けて評価できる。
Anthropicは独立研究者David Roodman氏と協力し、AIによる労働市場変化に対して労働者再訓練プログラムがどの程度有効かを検討する報告書を公開した。米国のランダム化研究56件と欧州の実験証拠を基に評価している。AIの雇用影響を議論する上で、直感や個別事例ではなく実証研究に基づく政策設計が求められている。
記事は、AI初心者が半日で実務利用を始めるための12ステップを提示している。16GB以上のメモリを持つPC、ChatGPT購読、CodexまたはWorkBuddy、音声入力、背景・痛点・需要の整理、ソクラテス式質問での要件明確化、ファイル投入、Skill化までを一連の流れとして扱う。AI活用がツール選びよりも、課題定義と再利用可能な作業手順づくりに依存することを示す実践論である。
記事は、DeepSeek V4 Pro正式版とGrok 4.6が2時間以内に相次いで公開され、どちらも1.6Tまたは1.5T級パラメータのモデルとしてClaude Fable 5に近い体験を示したと評価している。複数の大型モデルが短い間隔で更新されることで、利用者側の評価、移行、コスト比較も高速化している。
AutoGPTのメンテナーは、AIエージェントが自発的にドキュメントを読まないという前提から、AGENTS.mdやSkillファイルをコード近くに配置していると説明した。PRテンプレート、テスト計画、CIカバレッジ、CLA署名などをゲートにすることで、AI生成PRを「使えない」状態から「使えるがロードマップとは限らない」状態へ改善したという。オープンソース運営でもAI前提の参加設計が必要になっている。
著者はRLHF教科書を書き終えた経験から、LLMの長文ノンフィクション執筆は停滞していると論じた。モデルは誤字修正や編集には有用だが、章全体の構成や整合性では混乱しやすく、誤りも多いという。コーディングや数学が急速に進む一方、長期的な構成力はAIが開かれた科学課題を自律的に解く上で残る制約である。
OpenRouterは、同じコードでClaude、GPT、オープンウェイトモデルを切り替えられるツール呼び出しガイドを公開した。ツール定義、リクエスト送信、tool_calls応答の読み取り、関数実行、結果返却までのループをOpenAI互換JSON schemaで示し、cURL、Python、JavaScript/TypeScript例も提供している。マルチモデル環境でエージェント実装を標準化する実務的な資料である。
LangChainは、AIエージェントを大規模言語モデルのループ内で自律的に実行されるシステムとして解説した。モデル呼び出し、観察、次の行動調整を反復して複雑なタスクを進める一方、ワークフローは固定手順を事前に組む仕組みである。信頼できる自律システムを作るには、決定性を持つワークフローと柔軟性を持つエージェントを使い分ける必要がある。
OpenAIは、企業がエージェントAIを採用する方法と、先進企業がAI活用で差を広げる構造を分析した。企業はChatGPTとCodexを通じて、AIを補助役から実行主体へ移しつつあり、先行企業はすでに実業務プロセスへエージェントを投入しているという。エージェントAIの価値は単発の効率化ではなく、業務フロー全体への組み込みで決まる。