AI Digest

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします

AI・LLMの最新ニュース(2026-10-09)

OpenAIはChatGPTの全ユーザーにGPT-6を順次提供し始めた。開発者の間では、Claude Haiku 5.5を使ってサブエージェントのコストを見直す検証記事が相次いだ。Googleは業務アプリをまたいで動くGemini エージェントとオフライン議事録アプリを出し、エージェントとオンデバイスAIの両方に手を広げた。国内では不正アクセスの多発を受け、攻撃者がAIを使っている前提で守りを固めるべきだという見方が広がっている。

ChatGPTにGPT-6搭載、無料版にも展開 操作できる画面を返す「Intelligent UI」も

必読モデル/リリースITmedia AI+ · ChatGPT、無料版を含む全ユーザーに「GPT-6」 回答内に“操作できる画面”を生成する「Intelligent UI」搭載

OpenAIはChatGPTに新モデルGPT-6を搭載した。有料プランから順に提供し、翌日から無料プランとGoプランにも広げる。回答にはテキストだけでなく、図、ボタン、フォームといった操作できる要素が入るようになる。ChatGPTを業務の入口にしている組織は、出力の形式と社内の利用ガイドを見直すことになりそうだ。

Claude Haiku 5.5登場、サブエージェント構成を見直す動きが相次ぐ

必読モデル/リリースZenn (LLM) · Haiku 5.5 を機に Sonnet 以下で動かしていたサブエージェントを見直した

AnthropicがClaude Haiku 5.5を公開した。紹介記事によると、Haikuでeffortを指定できるのは今回が初めてで、単価はHaiku 4.5のちょうど10分の1になったという。Sonnet以下で動かしていたサブエージェントを置き換える事例や、effortごとの性能を測ったベンチマークもZennに続けて投稿された。要約や分類、ブラウザ操作など呼び出し回数が多い処理では、モデルの割り当てを見直す余地がある。

Google、Gemini Enterpriseに業務を任せられる汎用エージェントを搭載

必読プロダクト/ツールTechCrunch AI · Google brings agentic AI to Gemini, starting with businesses

Googleは「Gemini at Work」イベントで、業務アプリやシステムをまたいで、バックグラウンドでタスクの計画から実行までこなすGeminiエージェントを発表した。サブエージェントへの作業の振り分けや複数モデルの併用に対応する。メールアドレス付きの「職場ID」も持つ。Google Workspaceを使う企業では、エージェントの権限と監査の設計が課題になる。

多発する情報漏えい、専門家は「AI悪用を否定する方が難しい」と合同で見解

注目規制/リスクITmedia AI+ · 「異常な事態」、AI悪用は「否定する方が難しい状況」──多発する情報漏えいにセキュリティ専門家が合同で見解 攻撃の特徴と対策方法は

今夏から国内で情報漏えいなどの被害公表が増えている。マクニカのブログでは、セキュリティ3社の専門家が「これまでと違う異常な事態」として攻撃の特徴と対策をまとめた。個々の事案でAIが使われたと外部から断定はできない。ただ、穴を見つけて突くコストが下がっている前提で、パッチ適用の速さと侵入後の被害を抑える設計を見直す必要がある。

Anthropic、オープンソース向けに無料の脆弱性スキャン「OSS Scanner」を開始

注目開発者向け/APIThe Verge AI · Anthropic launches free AI security scans for open-source projects

申し込んだOSSプロジェクトに対し、Anthropicが同社の最上位モデルで定期的にセキュリティスキャンを無料で行う。メンテナーは脆弱性の通知を早く受け取れる可能性がある。一方で、コードや検出結果の扱いがどうなるかは、参加前に確認しておきたい。

Cloudflare、選択肢から「選ぶ」だけのオープンウェイトモデル「Clef」を公開

注目開発者向け/APIInfoQ AI/ML · Cloudflare Open Sources Decision Models for AI Agents

Clefは文章を生成しない。あらかじめ決めた選択肢の中から判定する専用のモデルで、9Bと27Bの2サイズが公開された。タスクに合わせて調整するための基盤も用意されている。ZennにはClef、OpenAIのDecisions API、Jevで日本語のタグ付けを比べた記事が出ている。投稿者の検証では正確さはほぼ同じで、1件あたりの費用に最大で約6倍の差があったという。エージェントの分岐判定や分類を安く回す手段として試す価値がある。

Anthropic、利用ポリシーを1年ぶりに改定 Claudeへの「執拗で不必要な虐待」も禁止

注目規制/リスクThe Verge AI · Anthropic bans ‘abusive or cruel behavior’ toward Claude

今回の改定では、選挙への干渉、兵器開発、監視、健康・金融分野での利用など、リスクの高い用途に関する規定が増えた。目を引くのは、Claudeに対する「執拗で不必要な虐待的・残酷な振る舞い」を禁じた点だ。普通の不満や批判は引き続き認められる。Claudeを組み込んだサービスを運営する事業者は、自社の規約と食い違いがないか確認しておきたい。

Google、完全オフラインで会議を文字起こしする「AI Edge Foresight」をmacOS向けに公開

注目プロダクト/ツールThe Verge AI · Google’s AI note-taking app transcribes your meetings completely offline

実験的なアプリとして無料で公開された。端末上で動くEmbeddingGemma 2モデルを使い、文字起こし、要約、内容への質問をネットにつながずに処理する。GranolaやWispr Flowに近い用途だが、音声を外部に送れない機密性の高い会議でも使える選択肢になる。

企業が使うオープンモデル、1年半で6割超が中国製に RedMonkが背景を分析

注目ビジネス/業界動向ITmedia AI+ · 企業が使うAIモデル、1年半で6割超が「中国製」に 「最高性能のオープンモデルはほぼ中国発」の理由

RedMonkはオープンウェイトモデルを、地理、ライセンス、能力、リスク、経済モデル、リリース時期、サイズ、蒸留の8つの観点から分析した。そのうえで、最高性能のオープンモデルはほぼ中国発だとしている。中国製モデルを採用する際は、性能とコストだけでなく、ライセンスや調達上のリスクも合わせて判断する必要がある。

OpenAIのAI生成の数学証明、専門家が定めた基準を満たさず

注目研究TechCrunch AI · OpenAI’s math solutions aren’t meeting the field’s standards yet

OpenAIが大量に出した証明は、同社が意見を求めた数学者グループのガイドラインから外れていたと報じられた。同社は9月、約1万のAIエージェントを使ってナビエ・ストークス方程式の問題を解決したと発表している。ただし、それはあくまでOpenAI側の主張だ。AIによる研究成果を、検証の手続きも含めてどう評価するかが改めて問われている。

Google、AI生成物の判定ツール「SynthID Detector」を一般公開

注目プロダクト/ツールITmedia AI+ · Google、AI生成物の判定ツールを一般公開 OpenAIやNVIDIA製サービスも対象に

これまでジャーナリストや研究者に限っていたSynthID Detectorを、誰でも使えるようにした。判定対象には、Google以外にOpenAIやNVIDIAのサービスで生成したコンテンツも含まれる。報道や社内コンプライアンスで、出どころの確認に使える手段が増える。

ELYZA、推論モデル「ELYZA-Thinking-1.0-llm-jp-4」の学習方法と評価結果を公開

注目研究Zenn (LLM) · 「ELYZA-Thinking-1.0-llm-jp-4」シリーズの学習方法と評価結果

ELYZAは、AIが自らの開発を改善する「再帰的自己改善」を研究する組織、ELYZA RSI Researchを立ち上げた。あわせて、llm-jp-4をベースにした推論モデルの学習手順と評価を公開している。Mid-trainingや教師ありファインチューニングの具体的な手順は、日本語モデルを追加学習するチームの参考になる。