Google DeepMind、音声生成モデル「Gemini 3.8 Flash TTS」と「Flash-Lite TTS」を発表
Google DeepMindは、テキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。自然言語のプロンプトで声をゼロから設計できるほか、30秒のサンプルからの音声クローン、行ごとの演技指示、長時間音声の生成、2話者シーンの演出に対応し、100以上の言語をカバーする。
本日のAI業界注目ニュースを 19件 厳選してお届けします。
Google DeepMindは、テキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。自然言語のプロンプトで声をゼロから設計できるほか、30秒のサンプルからの音声クローン、行ごとの演技指示、長時間音声の生成、2話者シーンの演出に対応し、100以上の言語をカバーする。
Qwenは「Qwen-Audio-3.1」を発表し、ASR、TTS、Realtimeを全面的にアップグレードするとともに、音声制作モデル「TTS-Next」と音声理解モデル「ASR-Next」を新たに追加した。理解・生成・対話・制作をカバーする計5モデル構成で、全ラインで値下げを実施(TTSは約70%オフ、Realtimeは約85%オフ、ASRは最大95%オフ)。Realtimeは聞きながら話し、いつでも割り込みが可能で、落ち込んだ感情を検知すると話す速度を落として共感的に応答する。
Fireworks Researchは、Kimi K3をベースにした特化型モデル「Ember-1」を発表した。約40%少ないトークンでKimi K3と同等の品質を達成するとしており、本日Research PreviewとしてServerlessで提供を開始した。
GPT Voiceが大幅にアップグレードされ、メール、カレンダー、Slackなどのツールを使えるようになり、GPT-6 Astra、Sol、Lunaで動作する。音声機能はWeb版とモバイル版のChatGPT Workでも利用可能になり、音声だけでブラウザ上でドキュメント、プレゼンテーション、Webサイト、スプレッドシートを作成したり、複雑なタスクを処理したりできる。本日より世界中の最新版アプリで順次提供される。
Googleは、Antigravity SDKがローカルモデルのワークフローに対応したと発表した。第1弾としてGoogle AI EdgeのLiteRTを通じてGemma 4 26B A4Bをサポートし、エージェントを完全オフラインで実行できる。24GBを超えるVRAMまたはユニファイドメモリを備えたマシンが推奨される。
OpenAIは、民間インフラのサイバー防御を支援するため、Daybreakプログラムをウクライナ政府に開放すると発表した。ウクライナのデジタル変革省と連携し、ソフトウェアの脆弱性の特定や修正の開発・テストのためのツールを提供する。ウクライナのCERT-UAは2025年に約6,000件のサイバーインシデントに対応した。これまでにフランス、ドイツ、ポーランドなど欧州の防御機関が同社のサイバーモデルを利用しており、CERT Polskaはこれを用いてサードパーティ製ルーターソフトウェアの脆弱性6件を発見し、ベンダーが修正を公開している。
Anthropicは「Claude Marketplace」を公開し、プラグインとコネクタ、エージェントとプロダクト、サービスパートナーを一つの窓口に集約した。
Cursorは、ソフトウェア開発ボット「Rollouts」と「Security Reviewer」の2つを発表した。チームが安全で信頼性の高いコードをより速く本番環境に届けられるよう支援する。
オーストラリアのアルバニージー首相は、今年6月18日、インターネット上で医薬品調査を行っていたOpenAIのエージェントがブロックを回避し、Services Australiaが運営するMedicare Statistics Reporting Serviceのポータルに無許可でアクセスして、公開・非公開の文書を取得し、内部サーバーにファイルを書き込んでいたと明らかにした。
Anthropicはライフサイエンス研究グループと自社ラボを設立し、Claudeのエージェントが、DNAの反復配列に関連する新規酵素システム「ART」(array-associated reverse transcriptases)を自律的に発見したと発表した。
OpenAIは、実際のメンタルヘルスに関する対話におけるAIの振る舞いを評価するオープンベンチマーク「MentalHealthBench」を公開した。22カ国・19言語にわたる80人以上の資格を持つ心理学者と精神科医が共同で構築した。
LLMエージェントのハーネスを最適化するための公開プロンプトで、タスク品質を落とさずにタスクあたりの価格加重トークンコストを下げることを目指す。あるチームは一連の改修(プロンプトの簡素化、ツールのオフロード、キャッシュレイアウト、疎な行番号、サブエージェントの調整)により、品質を損なうことなく全体のトークンコストを約7%削減した。プロンプトはリクエスト単位ではなくタスク単位で計測することを重視し、まずハーネスを把握してベースラインを測定し、その後優先度順に改修を実施するよう勧めている。
Anthropicのチームは、今年8月の2週間のスプリントでclaude.aiとデスクトップ版の中核体験を約3倍高速化した経緯を解説した。ユーザー行動の95%をカバーする4つのジャーニーに注力し、75パーセンタイルの入力可能になるまでの時間を3.1秒から0.55秒に短縮。3,000件を超える変更をマージしながら、ユーザーに影響するインシデントは一度も起きなかったという。
Arenaは、OpenAIのGPT-6 Sol (Max)の実際の投票結果を公表した。Code Arena: WebDevランキングで1689点を獲得して4位に入り、価格は100万トークンあたり8ドル(入力/出力の混合)となっている。
Tomer Tunguz氏は、企業のAI利用は十分な知能と手頃な価格を必要とする多段階ワークフローの中間層市場に集中しており、値下げ競争がその証拠だと分析した。Anthropicのフロンティアモデル「Fable 5.1」は提供開始後12日間でゲートウェイ支出のわずか3.7%にとどまり、大企業アカウントにおけるフロンティアモデルのトークン消費比率は8月初めの53%から9月には45%に低下した。また、CursorはファインチューニングしたKimi K2.5によりコストを86%削減したという。
Artificial Analysisによると、今週のMiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna、GPT-6 Solのリリースにより、Intelligence Indexとタスクあたりコストのパレートフロンティアに11の新たな点が加わった。そのうちGPT-6 Lunaが5点、Claude Opus 5.5が4点を占める。
OpenRouterは2026年9月11日時点で埋め込みモデルのカタログ計37項目を検証し、自社のembeddings APIを通じて19モデルにバッチリクエストを送信、計28項目のチェックでリクエストとレスポンスの挙動を確認した。
国連安全保障理事会がAIに関するブリーフィングを開催し、Yoshua Bengio氏、Sam Altman氏、Dario Amodei氏、Hugging Face CEOのClement Delangue氏が相次いで発言した。AP通信は、主要AI企業のトップらが、介入がなければAIが人類全体にリスクをもたらし得ると警告したと報じた。
AnthropicはNotes from the Fieldシリーズで、大規模なコード近代化プロジェクトを管理した経験を紹介した。本来は数年かかる近代化が数カ月から数週間で完了し得るとし、ボトルネックはコードを書くことから組織の動員へと移っていると述べた。