AI Digest

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします

AI・LLMの最新ニュース(2026-10-03)

macOSのフルディスクアクセス制限、Claude 5世代への移行時の互換性問題、Docker Sandbox Kit Specの寄贈と、AIエージェントの権限と安全な実行環境に関する発表が目立った1日でした。モデルでは、OpenAIがDevDayでGPT-6.1 Solなどを発表し、GoogleはGemini 4 Argonを限定公開しました。国内ではELYZAがLLM-jp-4ベースの推論モデルを無料で公開しています。

Claude Opus 5 / Sonnet 5へはmodel名の変更だけでは移行できない 壊れる7つのポイント

必読開発者向け/APIZenn (LLM) · Claude Opus 5 / Sonnet 5 に model だけ変えて移行すると壊れる 7 つの理由

旧世代のClaude APIコードで、model指定だけをclaude-opus-5やclaude-sonnet-5に書き換えると不具合が出ます。記事は公式移行ガイドを根拠に、思考の既定オン化、サンプリングパラメータやプリフィルの廃止、強制ツール呼び出しの廃止、拒否を示すstop_reasonの追加などを挙げています。400エラーになる箇所と、エラーなしで挙動が変わる箇所を分けて解説し、該当箇所をfile:line単位で検出する走査ツールも公開しています。

OpenAI DevDay 2026まとめ GPT-6.1 Sol、Agents APIのcomputer use、Decisions API

必読モデル/リリースInfoQ AI/ML · OpenAI DevDay 2026 Recap for Developers

OpenAIはDevDay 2026で、新モデルGPT-6.1 Solを発表しました。Agents APIのcomputer use対応、クラウド上で動くCodex環境、新しいDecisions API、ChatGPTのプラグイン機能拡張もあわせて公開しています。エージェントの実行環境から判断用APIまでOpenAI側で揃うため、自前で組んだ構成を見直すきっかけになります。

Apple、AIエージェントの普及を受けmacOSの「フルディスクアクセス」を厳格化

必読規制/リスクTechCrunch AI · Apple says it’s tightening macOS ‘Full Disk Access’ controls due to new risks from AI agents

Appleは、macOSのFull Disk Access権限に新しい制御を加えると発表しました。理由として、高性能なAIエージェントがファイル、メッセージ、メール、閲覧履歴へ広くアクセスできる状態のリスクを挙げています。背景には、Meta Museのメッセージ読み取りをめぐる両社の見解の対立があります。Macで動くエージェントやローカル連携ツールを作る開発者は、権限付与の手順が変わる前提で準備が必要です。

Google「Gemini 4 Argon」発表 一般提供は「できるだけ早く」

必読モデル/リリースITmedia AI+ · 「Gemini 4 Argon」とは 性能評価にみるAstra/Fable/Opusとの違い 一般提供は年内?

GoogleがGemini 4 Argonを発表しました。Google自身の評価では、GPT-6 Astra、Fable 5.1、Opus 5.5を多くの項目で上回るとしていますが、第三者による検証はまだありません。当面はサイバー防御組織などに限って提供され、一般の開発者がAPIで使える時期は決まっていません。

GPT-6 Astra UltrafastがAPIで提供開始 NVIDIAは「Standard比最大8倍速」と説明

注目モデル/リリースNVIDIA · How NVIDIA GPUs Help Accelerate OpenAI’s GPT-6 Astra Ultrafast

GPT-6 Astraの高速モードUltrafastが、OpenAI APIと対象のChatGPT Work・Codexユーザーに提供されました。NVIDIAによると、Blackwell GPU向けの推論最適化で、トークン生成速度はStandardモードの最大8倍です。応答の待ち時間がUXを左右するエージェントやコード補完では、モデルの選び方が変わる可能性があります。

ELYZA、国産「LLM-jp-4」ベースの推論モデル2種を無料公開

注目モデル/リリースITmedia AI+ · 国産AI「LLM-jp-4」ベースのAIモデル、KDDI傘下のELYZAが無料公開

KDDI傘下のELYZAが、ELYZA-Thinking-1.0-llm-jp-4-33bと、MoE構成の32b-a3bを公開しました。国立情報学研究所のオープンモデルLLM-jp-4に事後学習を加えたものです。学習データの出自が比較的明確な国産ベースの推論モデルなので、海外製モデルを使いにくい業務でも候補に入れやすくなります。

Docker、AIエージェントの権限をOCIイメージで配布する「Sandbox Kit Spec」をCNCFへ

注目開発者向け/APIInfoQ AI/ML · Docker Sandbox Kit Spec: Packaging AI Agent Permissions as OCI Images

Dockerは、エージェントがアクセスできる範囲を定義するSandbox Kit仕様をCNCFに寄贈すると発表しました。権限の設定をOCIイメージとしてエージェント本体と一緒に配布できるようにする狙いです。これまで環境ごとに手作業で書いていたサンドボックス設定を、コンテナと同じ流れで管理しやすくなります。

Liquid AIが判断モデル「d1」公開 Jev互換SDKで接続先を変えるだけ、現在は無料

注目モデル/リリースZenn (LLM) · Jev互換の判断モデル「d1」をLiquid AIが公開 — 多言語・無料・Jevと同じSDKでそのまま動く

Liquid AIが判断特化モデルd1を公開しました。文章を生成せず、Yes/No・選択・スコアの3形式で確率付きの判定を返します。Jevと同じSDKとAPI形式で動くため、既存コードは接続先を差し替えるだけで済みます。Liquid AIは、Hugging FaceのDecision IndexでJevを初めて上回ったと主張しています。前日にはCloudflareも判定モデルClefを公開しており、分類やフィルタリング用途で選べるモデルが一気に増えました。

Microsoft、ストリーミング文字起こし「MAI-Transcribe-2-Streaming」と音声合成「MAI-Voice-2.1」を公開

注目モデル/リリースITmedia AI+ · Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」公開 音声合成「MAI-Voice-2.1」と高速版も

Microsoft AIは、低遅延で逐次認識するMAI-Transcribe-2-Streamingと、声のトーンを保ったまま多言語で合成できるMAI-Voice-2.1、その高速版を発表しました。いずれもMicrosoft Foundryでプレビュー提供中です。音声認識から合成まで同じ基盤で揃えられるため、音声エージェントを作る際のベンダー選びが単純になります。

OpenAIのエージェント基盤「Dots」 業務向けを前面に出した設計

注目プロダクト/ツールThe Verge AI · OpenAI’s Dot agent is enterprise software that can also order your dinner

OpenAIが新しいエージェントプラットフォームDotsを発表しました。The Vergeは、一般消費者向けのMeta Museと比べて、Dotsは食事の注文もこなせるものの基本は業務ソフトに近い作りだと評しています。OpenAIとMetaのエージェント戦略が企業向けと一般向けに分かれてきたことが、この比較から見えてきます。

ホワイトハウス、主要テックCEOにAI安全誓約へ署名させる AIを「super intelligence」と呼び替える大統領令も

注目規制/リスクTechCrunch AI · It’s not AI anymore, it’s ‘super intelligence’ (according to the White House)

Zuckerberg、Bezos、Musk、AnthropicのDario Amodeiらがホワイトハウスに集まり、Trump大統領が「道義的拘束力がある」とするAI安全誓約に署名しました。同時に、AIを公式に「super intelligence」と呼び替える大統領令も出されています。誓約に法的な強制力はありません。ただ、米国の主要ベンダーが安全対策について政権と足並みをそろえた形になり、今後の規制議論の出発点になり得ます。

Anthropic研究:ロボットは米国労働時間の34%を「実行可能」、ただし人間より安いのは0.3%

研究Zenn (LLM) · ロボットは仕事の34%を「できる」――でも人間より安いのは0.3%

Anthropicは約900職種・約1万9,000タスクを分析し、現在のロボットは物理タスクの74%を何らかの環境で実行できると推計しました。米国の全労働時間に換算すると34%にあたります。一方、人間より安く実行できるタスクは0.3%にとどまりました。いずれもAnthropic研究チームの推定で、第三者による追試はまだありません。「技術的にできる」ことと「導入して採算が合う」ことの間に大きな差がある、と数字で示した点が要点です。