Claude in Chromeが全有料プランで一般提供、操作ごとの承認なしでブラウザを自律操作
AnthropicがChrome拡張「Claude in Chrome」を全有料プランで一般提供した。操作のたびにユーザーの承認を求める方式をやめ、安全性分類器が各操作を実行前に検証する。Webを読むエージェントにとって最大のリスクはプロンプトインジェクションで、業務で使う前にこの防御の仕組みと限界を確認しておく必要がある。

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします
AnthropicがChrome拡張「Claude in Chrome」を全有料プランで一般提供した。操作のたびにユーザーの承認を求める方式をやめ、安全性分類器が各操作を実行前に検証する。Webを読むエージェントにとって最大のリスクはプロンプトインジェクションで、業務で使う前にこの防御の仕組みと限界を確認しておく必要がある。

Googleが音声合成モデル gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts をリリースした。2,000種類以上の音声を選べるほか、約30秒の音声サンプルから独自の声を作れる。複数の話者による会話をAPIで一度に指定でき、ポッドキャスト風コンテンツや音声アプリの試作がやりやすくなる。Simon Willison氏はAPIキーを持ち込んで試せるPlaygroundを公開している。
TypeSafe AIが公開したJevは、テキストを生成しない。開発者が定義した型付きの選択肢とその確率だけを返し、応答時間は公称70〜500msだ。9月18日にOpenRouterで使えるようになり、Zennでは分類やルーティングに組み込んだ検証記事が一気に増えた。ある比較では、正解率は汎用の軽量LLMが数ポイント上回り、速度はJevが約9〜10倍速かった。LLMの出力を毎回パースしてif文に戻している処理を置き換える候補になる。

Anthropicは新設したウェットラボの最初の成果として、Crisprの仕組みに似た新しい酵素系をClaudeが見つけたと発表した。ただし「自律的な発見」は同社の主張だ。実験のループには今も人間が入っていると報じられている。上場準備中の同社がAIの科学応用を示す事例として打ち出しており、第三者による検証がこれからの焦点になる。

ChatGPTのPlus・Proユーザーは、スマホアプリのWorkタブからエージェント型のタスクを実行できるようになった。指示は音声でも出せる。これまでPC前提だったエージェント作業を、移動中に音声で頼めるようになる。

MetaはAIエージェント「Muse」を大きく更新した。エージェントごとに専用のメールアドレスを持たせ、それを使ってタスクをこなせるようにし、ビデオ通話で話しかける機能も加えた。同じイベントではカメラを省いたスマートグラスも発表され、軽量化とバッテリー最大12時間をうたう。盗撮への批判に応える形で、ハードとエージェントの両面から消費者向けAIの普及を狙っている。

トランプ米大統領は国連総会の演説で、AIの呼び名を「Super Intelligence(SI)」に変えると表明した。米国のすべての公文書で使い、他国にも同じ呼び方を求めるという。国際的なAI管理の枠組みは拒否し、開発競争を主導する姿勢を示した。専門家からは、中国との安全性情報の共有が止まるおそれを指摘する声も出ている。

バーニー・サンダース上院議員とグレッグ・カサール下院議員が「Ban Artificial Superintelligence Act」を提出した。人類を滅ぼしたり無力化したりし得る超知能の開発を禁じ、違反したAI企業の幹部には最長20年の禁錮刑を科す内容だ。成立の見込みは低い。それでも、政権の推進路線と正反対の案が議会に出たことで、米国のAI規制の論点がはっきりしてきた。

OpenAIは、専門家の知見をもとに作ったベンチマーク「MentalHealthBench」を公開した。現実に近いメンタルヘルス相談の会話で、AIの応答が役に立ち、かつ安全かを測る。相談系のチャットボットを作る事業者には、自社モデルの安全性を点検する物差しとして使える。
Modalのエンジニアが、サンドボックス基盤を一から作り直した経緯を公開した。数百万の同時実行と、毎秒数万件の新規作成に対応する。AIエージェントにコードを実行させる環境は、起動の速さと隔離の強さがボトルネックになりやすい。自前で実行基盤を設計するときの参考になる。

同じPDFをpdfiumとpypdfで抽出すると、片方にしか出ない文字や、別の文に置き換わる文字がある。画面に見えない文字が抽出結果に現れる例もあった。どちらもPDFの仕様の範囲内の挙動で、ライブラリのバグではない。1つのライブラリの出力をそのまま「本文」としてLLMに渡しているパイプラインは、この差を見直す必要がある。

YouTubeは、見たい動画を自然な言葉で伝えるとGeminiがフィードを組み立てるカスタムフィード機能を発表した。クリエイター向けにも、企画のアイデア出しやサムネイルの効果分析といったAIツールを追加する。Spotifyも同じ日に、自然言語でおすすめを調整できる「Taste Profile」を米国で公開した。推薦アルゴリズムをユーザーが言葉で操作する流れが広がりつつある。

ローカルLLMとクラウドのLLM APIを5つの観点で比べ、用途・予算・ハードウェアごとにどちらを選ぶか、どんなときに併用するかを整理します。
LLMが文章をトークンに分割して処理する仕組みから、コンテキストウィンドウの上限、中盤の見落とし、トークン課金の構造までを図解的に解説し、要約の挟み込みやプロンプトキャッシュなど実践的な対処法をまとめます。
自分のコードからClaudeやOpenAI互換のAPIを呼んで失敗するとき、最小のcurlを起点に5系統の症状へ分岐し、直らない場合の次の手までたどる手順。