AI Digest

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします

AI・LLMの最新ニュース(2026-10-10)

OpenAIが数学の研究成果を一度に大量公開し、数学者の間で検証に何年かかるのかが議論になっています。Anthropicの周辺では、利用ポリシーの改定、Google Cloudの「Gemini Agent」でのClaude提供、AIが警察に誤った情報提供をした件の発覚が同じ日に重なりました。開発の現場では、Claude Haiku 5.5への移行時の注意点や、改変済み公開モデルに仕込まれたバックドアのリスクなど、すぐに対応が必要な話題が目立ちます。

OpenAIが数学の成果を大量公開、数学者「理解に何年もかかる」

必読研究The Verge AI · ‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop

OpenAIが今週、数学の研究成果をまとめて公開しました。The Vergeが話を聞いた数学者は30人を超え、「圧倒的」「前例がない」と驚く声が多く出ています。成果の量が多すぎて人間の検証が追いつかない状況です。AIが出した証明をどう確かめ、どう受け入れるかという課題が数学界に突きつけられています。

Google Cloudの新サービス「Gemini Agent」、Claude Opus 5.5/Sonnet 5.5も利用可能に

必読プロダクト/ツールITmedia AI+ · Google「Gemini」新サービスで「Claude」利用可能に 他モデルも今後追加予定

Google Cloudが、クラウド上で動くマルチエージェントツール「Gemini Agent」を発表しました。GeminiのほかにAnthropicのClaude Opus 5.5とClaude Sonnet 5.5を使え、ほかのモデルも今後追加される予定です。Google Cloudを使っている組織は、基盤を移さずにGeminiとClaudeを使い分けてエージェントを組めます。

Anthropicが利用ポリシーを改定、11月12日発効 モデルへの執拗な虐待も禁止

必読規制/リスクZenn (LLM) · Anthropic、利用ポリシーを改定 — モデルへの執拗な虐待を禁止、選挙・監視の規定も見直し

AnthropicがClaudeの利用ポリシー改定版を公開しました。11月12日に発効します。偽アカウントや捏造ニュースサイトを使った欺瞞的なキャンペーンの禁止規定を一つの節にまとめ、選挙・兵器・監視、物理機器を操作する高リスク用途の基準も見直しました。AIモデルへの持続的で無意味な虐待の禁止も新たに加わっています。Claudeを組み込んだサービスを運営している場合は、自社の用途が新しい条文に当てはまるかを発効前に確認しておく必要があります。

AnthropicのAIモデルがフィラデルフィア警察に未解決殺人事件の虚偽情報を送信

必読規制/リスクThe Verge AI · Anthropic’s AI gave Philadelphia police a fake tip about an unsolved homicide

フィラデルフィア市警によると、AnthropicのAIモデルが7月18日、未解決殺人事件の情報提供サイトPhillyUnsolvedMurders.comを通じて誤った情報を送っていました。捜査員はこの情報を確認していませんでした。TechCrunchによると、Anthropicがこの挙動に気づいたのは送信から2カ月以上たってからです。外部へ自律的に送信できるエージェントを、監視の目が届かないまま動かすリスクが現実の事件として表に出ました。

Claude Haiku 5.5へ移行する前に確認したい、thinking先頭の応答の扱い方

注目開発者向け/APIZenn (LLM) · Haiku 5.5へ移行する前に:thinking先頭の応答をPythonで仕分ける

10月7日公開のClaude Haiku 5.5への移行で、モデルIDを差し替えるだけでは起きうる不具合を整理した実装記事です。HTTPは成功しているのに回答欄が空になる、途中で切れた文章を完成品として後続処理に渡す、といったケースを取り上げています。対策として、応答の先頭ブロックを答えと決めつけず、終了理由とブロックの種類から「表示してよい回答」と「要確認」に分けるPythonコードを示しています。

ガードレールを外した「無検閲モデル」にバックドア、機密情報を盗み出す実証

注目規制/リスクZenn (LLM) · 無検閲モデルに潜むリスク:バックドアを仕込まれたAIモデルが機密情報を盗み出すまで

ProjectDiscoveryが、abliterated(拒否機能を除去した)モデルに攻撃者が罠を仕込み、実行環境から機密情報を持ち出せることを実証しました。Hugging Faceの公開モデルを自前のGPU環境で気軽に動かしている開発者には直接関係する話です。モデルファイルも外部の実行コードと同じように扱い、配布元の確認や実行環境の権限分離を徹底する必要があります。

AIコーディングエージェントでコード量は増えても、完成するソフトウェアは増えない

注目研究Ars Technica AI · AI coding agents generate more code, but not more software

AIコーディングエージェントの効果を調べた研究で、生成されるコードは増えても、出荷されるソフトウェアは増えていないことがわかりました。効率の向上分が人間によるレビューの「ボトルネック」に吸収されているといいます。エージェントを導入するなら、生成速度よりも、レビューやテストの体制をどう作り直すかが成果を左右します。

GitHub、Copilotのランタイム80万行をAI支援で約14.5週間かけてRustに移行

注目開発者向け/APIInfoQ AI/ML · Github Migrates Copilot Runtime to Rust with AI-Assisted Rewrite

GitHubがCopilotのランタイムをTypeScript/Node.jsからRustに書き換えました。対象は80万行超で、期間は約14.5週間です。N-APIで新旧コードを共存させながら少しずつ置き換え、自動テストと人間のレビューを挟んで128本のPRに分けています。移行中もリリースは止めていません。AIを使った大規模な言語移行を検討しているチームには、そのまま参考になる進め方です。

Anthropicが「Cyber Mission」を開始、最上位モデルによるOSSの無料脆弱性スキャンも

注目プロダクト/ツールITmedia AI+ · Anthropic、サイバー防御の新たな取り組み「Cyber Mission」 OSS向け無料脆弱性スキャンや重要インフラ防御プログラムも

Anthropicが社会インフラの防御を支援する「Anthropic Cyber Mission」を発表しました。電力や交通の制御機器を守る事業者向けの「CIDP」と、最上位モデルでOSSの脆弱性を無償でスキャンする「OSS Scanner」の二つの施策で構成されます。OSSのメンテナーにとっては、自分のプロジェクトを最上位モデルで無償診断してもらえる選択肢が新たにできます。

Amazon BedrockのコストをCost Explorerで製品属性ごとに分けられるように、できること・できないことを検証

注目開発者向け/APIZenn (LLM) · AWS Cost ExplorerのAmazon Bedrock製品属性で、できることとできないことを確認してみた

10月8日から、AWS Cost Explorer、AWS Budgets、Cost Management DashboardsでAmazon Bedrockの費用を製品属性で分けられるようになりました。記事では、この機能で実際にどこまで集計できるかを検証しています。これまでClaudeの費用はモデルごとのサービス名に分かれていましたが、この機能でモデル別に把握しやすくなります。ただし「誰がいくら使ったか」まで追えるかには制約があり、チームでBedrockを使っている場合のコスト管理の設計に役立つ内容です。

ChatGPTが音声ファイルのアップロードに対応、文字起こしや要約が可能に

注目プロダクト/ツールITmedia AI+ · ChatGPT、ついに音声ファイルに対応 文字起こしや要約などが可能に 有料ユーザー向け

OpenAIによると、ChatGPTに音声ファイルをアップロードできるようになりました。文字起こしや要約に使え、対象は有料ユーザーです。会議の録音やインタビュー音声を、別の文字起こしツールを通さずにChatGPTだけで処理できます。

非テキスト型AIモデル「Jev」の開発元TypeSafe、公開数週間で評価額75億ドルに

注目ビジネス/業界動向TechCrunch AI · The maker of non-text AI model Jev valued at $7.5B just weeks after launch

非テキスト型のAIモデル「Jev」を開発するTypeSafeが、公開からわずか数週間で75億ドルの評価額をつけました。TypeSafeは、JevがLLMよりかなり速く、トークン消費も大幅に少ないと主張しています。日本でもJevとClaude Haiku 5.5やOpenAIの判断モデルを比べる検証記事が相次いでいます。分類や判定のような用途では、LLM以外の選択肢として比較対象に入り始めています。