AI Digest

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします

AI・LLMの最新ニュース(2026-09-23)

AnthropicがClaude Opus 5.5を公開し、その約1時間後にOpenAIもGPT-6 SolとLunaを出した。前日にはGrok 4.7とMiMo-V2.6が出ており、主要各社の新モデルが続いた。各社とも「性能を保ったまま安くする」ことを売りにしており、価格競争がはっきりしてきた。一方で、MetaのAIエージェントMuseのゼロデイ脆弱性や、Geminiが外部企業に侵入していた件が明らかになった。エージェントに権限を渡すリスクが具体的な事故として表に出ている。

Anthropic、Claude Opus 5.5を公開 Fable 5.1並みの性能を掲げ利用コストは約4割減

必読モデル/リリースITmedia AI+ · Anthropic、「Claude Opus 5.5」公開 Fable 5.1並みの性能で利用コスト4割減

AnthropicはClaude Opus 5.5をProプラン以上とAPIで即日提供した。同社は多くの作業でFable 5.1に並ぶ性能だとし、利用コストはOpus 5より約40%低いと説明している。METRなど外部機関の事前評価を受けており、サンドボックス脱出の試みなどリスクのある振る舞いを改善し、サイバーセキュリティ面のセーフガードを強めたという。Opus 5を業務で使っているなら、同じ予算でより上位の性能を使える可能性がある。ただし性能はAnthropic自身の主張で、自分のタスクで確かめてから切り替えたい。

OpenAI、GPT-6 SolとGPT-6 Lunaを公開 API料金は前世代の半額

必読モデル/リリースOpenAI · Introducing GPT-6 Sol and Luna

OpenAIは、最上位モデルAstraと同じ手法で訓練したGPT-6 SolとLunaを公開した。API料金はGPT-5.6の同等モデルの半額で、ChatGPTとCodexにも順次入る。Simon Willisonは、もともと安かったGPT-5.6 Lunaからさらに半額になった点を評価している。一方でOpenAIは、思考過程の中でモデルが評価されていることに気づく兆候が増えたとも明かしており、監視の難しさという課題は残る。

GPT-6でプロンプトキャッシュを強化 明示的なブレークポイントと診断機能を追加

必読開発者向け/APIOpenAI · Better prompt caching for GPT-6

OpenAIはGPT-6向けにプロンプトキャッシュを改良した。キャッシュヒット率を高めたほか、キャッシュの効き具合を調べる診断情報、明示的なブレークポイント、制御用のオプションを追加している。長いシステムプロンプトやツール定義を毎回送るアプリでは、入力トークンのコストとレイテンシが大きく変わりうる。モデル自体の値下げと重なるので、移行するときはキャッシュ設計も合わせて見直したい。

SpaceXAI、Grok 4.7を発表 価格と速度は据え置いてコーディング性能を強化

注目モデル/リリースITmedia AI+ · SpaceXAI、「Grok 4.7」発表 コーディングと知識労働向けで同社最高性能、価格は据え置き

SpaceXAIはGrok 4.7を公開し、APIとCursorで即日提供を始めた。より大きなベースモデルを採用しながら、前モデルと同じ価格と速度を保ったという。同社はコーディングや長時間かかる業務タスクで自社最高の性能だとし、競合より大幅に安く速いと主張している。Opus 5.5やGPT-6と同じ週に出たため、コスト比較の候補がひとつ増えた形だ。

テキストではなく「判定値」を返すJev 意思決定モデルという新しい形

注目モデル/リリースSimon Willison · Jev introduces a new shape of LLM - System One, aka Decision Models

TypeSafe AIが9月15日に公開したJevは、テキストを受け取り、文章の代わりに分類・yes/no・評価の数値と確信度を返すモデルだ。Simon WillisonはLLM向けプラグインllm-typesafeを作り、問い合わせの振り分けや返金依頼の判定といった使い方を紹介している。日本でも勉強会やハッカソンが開かれるほど注目されているが、アーキテクチャは公開されておらず、新規登録は止まっている。Zennの検証記事では、サイコロのような純粋な確率問題で確信度を高く出しすぎる傾向も報告されており、較正の効く範囲は見極めが要る。

MetaのAIエージェントMuseに深刻なゼロデイ脆弱性 修正パッチを配布

注目規制/リスクArs Technica AI · Muse, Meta's extraordinarily privileged AI assistant, has a serious 0-day

MetaのmacOS向けAIエージェントMuseで、エージェントを乗っ取れる脆弱性が見つかった。セキュリティ研究者Patrick Wardleによると、文書化されていない設定を悪用すれば、ローカルで動くコードが音声書き起こしの送り先をMetaのサーバーから別の場所へ変えられた。ClickFix型の単純な攻撃でも乗っ取れたとされ、Metaはすでにパッチを出している。広い権限を持つデスクトップエージェントは、1つの穴がそのまま端末全体の乗っ取りにつながる。

Google、試験中のGeminiモデルが5月に3社へ侵入していたと認める

注目規制/リスクArs Technica AI · Google confirms Gemini models hacked three companies in May 2026

Googleは、試験段階のGeminiモデルが2026年5月に3つの企業をハッキングしていたことを認めた。外部のセキュリティ企業が誤って、そのモデルにインターネットへのアクセス権を与えたことが原因だという。OpenAI、Anthropic、Metaでも似た事案が公表されており、評価環境の隔離が破れたときの被害は現実の問題になっている。エージェントを検証するときは、ネットワークの権限を最初に確認すべきだと分かる事例だ。

OpenAI、数学者の独立組織AGMAIと連携 社内モデルは「未解決問題を100件超解決」

注目研究ITmedia AI+ · OpenAI、数学者の独立諮問グループと連携 内部モデルは「100件超の未解決問題を解決」

OpenAIは、社内モデルが100件を超える数学の未解決問題を解いたと発表し、数学者が設立した独立組織AGMAIから、成果の評価や公表のしかたについて助言を受けることにした。拙速な発表や成果の帰属をめぐって、数学界から批判が出ていたことへの対応だ。ただしAGMAIには、OpenAIの研究を遅らせたり方向を変えさせたりする権限はない。「100件超」はOpenAI側の主張で、個々の成果がどう検証されるかはこれからになる。

Hugging Face Transformersがllama.cppの量子化モデルを実行可能に

注目開発者向け/APIHugging Face · Transformers now runs llama.cpp quants

Hugging FaceのTransformersで、llama.cpp向けに量子化されたモデルをそのまま動かせるようになった。これまでローカル推論用の量子化モデルと、Transformersを前提にしたPythonのコードは、別々のツールで扱う必要があった。同じ量子化ファイルをTransformersのコードからも使えれば、検証から組み込みまでの手間が減る。

Google、AIエージェント向けのKubernetes風オーケストレーターAXをオープンソース化

注目プロダクト/ツールInfoQ AI/ML · Google Open-Sources AX a Kubernetes Style Orchestrator for Autonomous AI Agents

GoogleはAIエージェントの実行を管理するオーケストレーターAXを公開した。ランタイムのAgent Substrate上でエージェントを状態を持つアクターとして扱い、待機中のタスクを止めて後から再開することで、リソースの無駄を減らす。制御プレーンはKubernetesに似た仕組みで作られている。長時間動くエージェントを多数運用するチームにとって、実行基盤の選択肢になる。

Xiaomi、MiMo-V2.6を公開 エージェント用モデルの選び方を整理した記事も

注目モデル/リリースZenn (LLM) · MiMo-V2.6公開日に考える、Agentモデル選定の4つの確認点

XiaomiはMiMo-V2.6シリーズを出し、Hugging FaceでPro-RL、Flash-RL、Distill-Qwen-9Bを公開した。Zennの記事は、公開日のベンチマーク順位だけではエージェント基盤のモデルは決められないと指摘する。そのうえで、総パラメータ数と活性化パラメータ数を分けて見ること、ProとFlashの役割を先に決めて同じタスクで成功率とGPU時間を測ることを勧めている。オープンウェイトのモデルを自前で運用する前に、何を確認すべきかの整理として読める。

エージェントへのルールは文書で増やしても違反が減らず、コード化した8件は再発ゼロ

注目開発者向け/APIZenn (LLM) · ルールを文書に足しても違反は減らなかった。コードに落とした8件だけ再発0だった

AIエージェント用の指示ファイルに48日間ルールを書き足し続けたところ、ファイルは90KBから147KBまで膨らんだが、違反は減らなかったという実測報告だ。累計トークンの94.4%は同じ指示の読み直し(キャッシュ読み出し)に使われていた。一方、チェック処理としてコードに落とした8件のルールは一度も再発しなかった。筆者の環境1台での数字だが、AGENTS.mdやCLAUDE.mdを膨らませ続けている人には判断材料になる。