Liquid AI、量子化認識蒸留のLFM2.5系Q4_0チェックポイントを公開、精度損失の97%を回復
Liquid AIは、量子化認識蒸留(QAD)で訓練したLFM2.5-230M、350M、1.2B-Instruct、2.6BのQ4_0 GGUFチェックポイント4種を公開した。ネイティブQ4_0のメモリと速度を保ちつつ、BF16に対する平均精度損失の97%を回復するという。小型モデルを低メモリ・高速のまま高精度で動かす、オンデバイス推論に効く量子化技術だ。
本日のAI業界注目ニュースを 14件 厳選してお届けします。
Liquid AIは、量子化認識蒸留(QAD)で訓練したLFM2.5-230M、350M、1.2B-Instruct、2.6BのQ4_0 GGUFチェックポイント4種を公開した。ネイティブQ4_0のメモリと速度を保ちつつ、BF16に対する平均精度損失の97%を回復するという。小型モデルを低メモリ・高速のまま高精度で動かす、オンデバイス推論に効く量子化技術だ。
智譜(Z.ai)はGLM-5.3のAPIを即日公開した。複雑なコーディング、防御的サイバーセキュリティ、長期タスクを得意とし、AA総合知能指数で60点を獲得。Claude Fable 5やGPT-5.6 Solなど閉源フラッグシップと同水準で、Kimi K3と並びオープンソースモデルの首位に立つ。より小さいパラメータ規模と低い呼び出しコストで前線級の知能の敷居を下げ、単一タスクのコストはフラッグシップ級で最安だという。API価格はGLM-5.2と同じで、モデルの重みは来週金曜に公開予定だ。
5秒・480Pの動画を、クラウドなしでMac上だけで30秒で生成できたという。CUDA不要で、メモリ使用は3.9GiBのみ。FastMetalはFastWan-QADシリーズをApple Siliconに移植したもので、DiT、DMDサンプラー、デコーダーをMLX経由でMetal上で動かし、既定はINT8だ。480P対応の1.3B、720P対応の5B、画質重視の14Bという3モデルを用意する。専用GPUやクラウドに頼らず、手元の端末で生成AIを動かす動きを象徴する。
Googleは検索に5つのAI学習ツールを追加した。AI Modeの生成的UIは英語版が全世界で公開され、インタラクティブな可視化やカスタムシミュレーションに対応する。練習クイズはAI OverviewsとAI Modeで英語版が無料提供され、ACTやSATなどの標準化試験をカバーする。検索そのものが学習支援の場へと機能を広げている。
Replitは、GPT-5.6 Luna駆動の「Free Mode」を公開した。トークンコストを気にせず、アイデアを動くソフトウェアに変えられる。GPT-5.6系の価格性能とOpenAIの直近の値下げを背景に数百万人へ開放し、素早い回答、提案、プロジェクト分析を提供する。より高度な推論が必要なときは、プロジェクトの文脈を保ったままGPT-5.6 Solへ切り替えられる。推論コストの低下が、エージェントによるソフト開発を無料で大衆化しつつあることを示す。
Claude Code v2.1.236は、新規セッションの既定モデルを指定できる環境変数`ANTHROPIC_DEFAULT_MODEL`を追加した。`/model`での選択は引き続き上書き可能で、再起動をまたいで保持される。開発支援エージェントの実運用に向けた細かな使い勝手の改善が続いている。
OpenAIは、OpenAI-Hugging Face事案と、近く投入予定のAstraモデルが「重大なサイバーセキュリティ能力の閾値」に達しうることを踏まえ、モデルの拡張を一時的に減速した。最新モデルの強化学習(RL)訓練を2週間停止するほか、研究環境の安全要件を強化し、ワークロード隔離、ネットワーク隔離、継続的なセキュリティテストを導入した。思考連鎖の監視範囲も拡大している。Astraやサイバー関連のワークロードには最も厳格な安全基準を課し、一部の訓練・評価は停止中だという。
OpenRouterは、Stripeとの統合を発表した。OpenRouterは現在、400以上のAIモデルから日次10兆トークン超を処理し、1000万を超える開発者・企業に利用され、設立以来、推論量は年10倍以上のペースで伸びてきた。統合後もOpenRouterは名称と使命を保ったまま独立して運営し、製品やロードマップ、ユーザー利益を優先するルーティング方針は変わらないという。取引は今後数週間で完了する見込みだ。
LMSYSは、1.6兆パラメータのMoEモデルDeepSeek-V4-Proについて、H20 GPU上でシナリオ別の提供構成を用いてB300に迫る性能を引き出した。単一ノードのH20-141GB参照実装で271 output tokens/sに達し、B300の383.7 tokens/sとの性能差を1.42倍まで縮めたという。制約のあるハードウェアでも構成の工夫で大規模MoEを実用的に提供できることを示す。
Appleの機械学習研究チームは、考えや感情の表出、利用者との関係構築、要求の拒否と境界の維持といったLLMの「人間らしい振る舞い」を、普遍性・潜在的影響・可制御性の面から多面的に分析した。LLM-as-a-judgeと人手評価を組み合わせ、2万1000件を超えるデータを用いて、いつ・どの種類の人間らしい振る舞いが望ましいかを判断する材料を提供する。
現代のAIエージェントは神経記号推論のために検索基盤に依存し、それはしばしば深くネストした非単調なブールクエリへコンパイルされる。標準的な転置インデックスの評価戦略には強い理論的限界があり、状態を持つ反復子モデル(Document-at-a-Time)はNC^1の式評価構造に制約され、再合流ロジックを展開すると最悪計算量がO(2^|Q|)で指数的に爆発するという。
GitHub Copilotアプリの「My work」パネルは、プルリクエストとイシューを一か所に集約する。All、Active、Review requests、Doneの4つの既定ビューを備え、カスタムビューやフィルタも作成できる。イシューやPRから直接エージェントセッションを開始でき、複数項目をまとめて選んでセッションを作ることも可能だ。リスト表示と表形式表示の切り替え、リポジトリ範囲の調整や新規イシュー作成にも対応する。
Slack最高製品責任者のJaime DeLangheが、会話を組織の知識に変え、人間とエージェントのチームを築く実践知を共有した。既定で公開チャンネルを使い、エージェントが見える会話から学べるようにすること、会議・メール・カレンダーなどの文脈をつなぎ重複作業を減らすことを勧める。SlackではClaude駆動のエージェントが下書き・要約・監視などの実務を担い、人間が確認・意思決定・引き継ぎを行う循環的な協働を形づくる。
Databricksは、単一のプロンプトから効果的なGenie Agentを設計する指針を公開した。汎用エージェントは売上などの問い合わせで最初に見つけた関連テーブルだけを参照しがちだが、Genie Agentはより精緻なプロンプト設計で、対象を正確に特定して回答できるという。エージェントの挙動を最適化し、クエリ結果の正確性と関連性を高めることを狙う。