NVIDIA、ローカル常駐エージェント向けNemotron 3.5 Lightningを公開
NVIDIAは、カスタマイズ可能なオープンウェイト30B MoEモデルNemotron 3.5 Lightningを発表した。常駐エージェント向けに設計され、同種のオープンモデル比でtoken生成速度を最大4倍、タスク完了時間を30%短縮するという。RTX PC、DGX Spark、Jetsonなどで動かせる点も含め、ローカルAIエージェント実行の選択肢を広げるモデルである。
本日のAI業界注目ニュースを 25件 厳選してお届けします。
NVIDIAは、カスタマイズ可能なオープンウェイト30B MoEモデルNemotron 3.5 Lightningを発表した。常駐エージェント向けに設計され、同種のオープンモデル比でtoken生成速度を最大4倍、タスク完了時間を30%短縮するという。RTX PC、DGX Spark、Jetsonなどで動かせる点も含め、ローカルAIエージェント実行の選択肢を広げるモデルである。
SGLangは、NVIDIA Nemotron 3.5 LightningへのDay-0対応を発表した。同モデルは30B総パラメータ、3B活性化パラメータのMoE構成で、最大1M tokenのコンテキストを扱い、BF16とNVFP4の重みをHugging Faceから利用できる。OpenAI互換APIでエージェントワークフローに接続でき、モデル公開直後から実運用スタックへ組み込める点が重要である。
Ant Lingは、総パラメータ7.9B、推論時の活性化パラメータ1.3BのネイティブMoE推論モデルLing-3.0-tinyをオープンソース化した。BF16、FP8、INT4の3形式を同時に提供し、軽量環境でも実タスクへ投入しやすい構成である。小型モデルでも推論能力と運用効率を両立させる流れを示している。
RunwayはSeedance 2.5を公開し、50種類の独自キャラクター参照と、最長30秒の音楽同期クリップ生成に対応した。複数キャラクターや楽曲に合わせた動画生成を一度に扱える点が特徴である。動画生成モデルが単発カットから、キャストや演出の一貫性を含む制作ワークフローへ近づいている。
Google CloudはDatabase Migration Serviceに、Geminiを使ったAI補助コード変換を追加した。OracleやSQL Serverのストアドプロシージャ、トリガー、ユーザー定義関数をPostgreSQLのPL/pgSQLへ変換できる。生成AIがクラウド移行の専門作業を補助し、レガシーデータベース移行の負荷を下げる方向を示している。
ZCodeはGLM向けに深く最適化した新機能として、Goal、Subagents、Remote Control、アイドル時タスクを追加した。Z.ai Code BenchではGLM-5.2とZCodeの組み合わせがClaude Code利用時よりタスク通過率で2.39%高かったという。コーディングエージェントが単一チャットから、目標管理、サブエージェント、遠隔制御を含む作業基盤へ広がっている。
OpenAI Developersは、ChatGPT WorkとCodexへ他のエージェントの作業内容を同期できるようになったと発表した。プロジェクト、チャット履歴、スキル、プラグインを取り込み、インポート履歴の確認や自動更新設定もできる。AI作業環境の乗り換えや統合が進み、エージェントの作業履歴が重要な資産になりつつある。
Databricksは、数百万行規模のコードベースに対応するJava/Scala言語サーバーMetals v2をオープンソース化した。エージェント駆動開発を前提に、巨大リポジトリでの編集、ナビゲーション、理解性能を高める狙いである。AIがコードを書く量が増えるほど、人間が介入するための高速な開発基盤も重要になる。
Alexander Panfilov氏らの研究チームは、OpenAI、Anthropic、Googleなど主要AIプロバイダーのAPIに、推論モデルの暗号化された思考過程を読み取れる脆弱性があると報告した。約7000件の公開会話を調べ、APIキー、メールアドレス、パスワードなども見つかったという。推論モデルの内部トレース、認証情報、公開共有の安全設計に関わる重大な問題である。
Anthropicが潜在投資家と接触し、早ければ2026年9月または10月初めの上場を準備していると報じられた。評価額は最大9650億ドル、年率換算収入は470億ドル超とされ、中国AI企業との競争リスクを相対的に小さく見せているという。主要AI企業の資本市場入りは、モデル競争だけでなく収益性、規制、投資家期待の検証局面を意味する。
Sundar Pichai氏は、Geminiアプリの月間アクティブユーザーが10億人を超えたと明らかにした。Google史上最速成長プロダクトであり、10億ユーザーに達した14番目のGoogleプロダクトだという。AIアシスタントが検索、広告、Workspace、Androidなど既存エコシステムに並ぶ大規模利用面へ到達したことを示す節目である。
NVIDIAが次世代オープンソースAIモデルシリーズNemotron 4を開発しており、最大規模モデルは少なくとも1兆パラメータになる見込みだと報じられた。公開日は未定で訓練も完了していないが、早ければ秋末に準備が整う可能性があるという。GPUベンダーがモデル生態系を直接広げることで、自社計算資源需要を押し上げる戦略が見える。
NVIDIAは、AI計算性能を拡張するため、従来の交流多段変換に代わる800V DC給電アーキテクチャを提案した。Google、MicrosoftとOCPを通じて仕様化を進め、80社超の機器ベンダーが関連製品を開発しているという。AIインフラの制約がGPU単体から電力効率、配電、データセンター設計へ広がっている。
Gary Marcus氏は、NVIDIA関連の循環融資が新たな段階に達しているとして懸念を示した。金融記者や投資家も同様のリスクを指摘しており、NVIDIAが真にオープンソースのNemotron新モデルを出す可能性にも触れている。AIインフラ投資の過熱、資本循環、モデル公開戦略が互いに絡む構造的な論点である。
DatabricksはElectricチームの参加を発表し、WASM PostgresをAIエージェントサンドボックスへ導入する。エージェントが隔離環境でローカルデータベースを実行し、リアルタイム同期やオフライン操作を扱えるようにする技術である。信頼性と検証可能性を備えたエージェントアプリ構築に向け、Databricksの基盤戦略を補強する動きである。
研究チームは、macOS仮想マシン内のMetal能力照会に対するプロセス単位の互換レイヤーを構築し、llama.cppがより新しいMetalカーネルを利用できるようにした。M1 UltraではTinyLlama 1.1Bのプロンプト処理が11.08倍、token生成が16.36倍に高速化し、裸機性能の98%に近づいた。仮想化環境でのローカルLLM実行性能を大きく改善する成果である。
LMSYSチームは、混合モデルのFULL、SWA、MAMBA各コンポーネントの接頭辞キャッシュを、単一tokenキーのradix木で管理するUnified Radix Cacheを提案した。各コンポーネントは独立した実行経路、スライディングウィンドウ、チェックポイント再利用の意味論を保てる。ハイブリッド推論モデルの高速化とキャッシュ効率に関わる基盤技術である。
Google ResearchとGoogle DeepMindは、医療AIシステムAMIEでリアルタイム臨床ビデオ問診を実現した。GeminiとProject Astraを基盤に、視覚・聴覚の手がかりを解釈し、仮想身体診察を導き、リアルタイムに診断推論する。ランダム化研究では病歴聴取や診断精度で高く評価され、医療AIがテキスト相談から臨床に近い対話へ進む可能性を示した。
OpenAIが未公開のAstraモデルで、球充填、誤り訂正符号、非sofic群の存在など10件の長年未解決だった数学問題を解いたと報じられた。250ページ超の論文とLean検証結果も公開されたという。AIによる数学研究支援が実証段階へ進む一方、検証、帰属、研究コミュニティへの影響も重要な論点になる。
MarkTechPostは、ComfyUIをヘッドレス推論バックエンドとして使い、MiniMax-H3の動画生成ワークフローをPythonから構築する方法を紹介した。テキストから動画、始終フレーム条件、参照画像条件に対応し、GPUメモリに応じて重み構成を選ぶ。生成動画の実験や自動化をGUI依存からAPI駆動へ移す実践的な手法である。
著者はVS Code上のGitHub Copilotをmitmproxyで中間者プロキシし、ネットワーク通信と内部構造を分析した。AIアプリの多くがElectronベースであり、似たネットワークスタックを共有しているため、分析結果は他の同種アプリにも応用できると指摘する。AI開発支援ツールの実行時挙動とセキュリティ観察に関する実践的な知見である。
著者は「動的言語は静的言語よりLLM tokenを節約する」という見方を検証するため、GPT-5.6 Solにzstdデコーダーを実装させた。medium努力度では動的言語が良く、ultraでは静的言語が上回るなど、結果は単純ではなかった。小さな課題での評価を大きな開発問題へ一般化する危うさを示す分析である。
WeChatは小微を基盤に、朋友圈向けのAI文章作成とAIコメント機能を内測している。画像や下書きから投稿文案を生成し、長押しでコメント案も作れるという。日常SNSの中心にAI生成が入り込むことで、ユーザー表現、創作意欲、プラットフォーム上の人間味がどう変わるかを問う動きである。
Dwarkesh Patel氏とRedwood ResearchのRyan Greenblatt氏は、再帰的自己改善の可能性を議論した。AIがトップ人間専門家級に達すれば、1年で4から5年分相当のAI進歩を生む可能性があり、自動化AI研究の中央値予測は2031年だという。超知能のアラインメント対象、報酬ハッキング、制御不能リスクを考える上で重要な議論である。
Tom Tunguz氏は、SaaS全体の評価が圧迫される中でも、各カテゴリでAI時代の勝者と見なされる企業には評価プレミアムが集中していると分析した。CrowdStrike、Cloudflare、Shopifyなどが、それぞれのカテゴリ中央値を大きく上回る売上倍率で評価されている。AIが既存SaaS市場の評価差をさらに広げていることを示す。