個人向けGeminiの無料ユーザーはFlash-Liteのみに Flashは「AI Plus」、Proは「AI Pro」以上が必要
Googleは個人向けGeminiで使えるモデルを契約プランごとに分けると告知しました。無料ユーザーが選べるのはFlash-Liteだけになり、Flashは「AI Plus」以上、Proは「AI Pro」以上の契約が条件です。無料枠でGeminiを試作や比較に使っていた人は、出力の質が変わる前提で使い方を見直す必要があります。

AI・LLMの最新ニュースを毎朝日本語でまとめてお届けします
Googleは個人向けGeminiで使えるモデルを契約プランごとに分けると告知しました。無料ユーザーが選べるのはFlash-Liteだけになり、Flashは「AI Plus」以上、Proは「AI Pro」以上の契約が条件です。無料枠でGeminiを試作や比較に使っていた人は、出力の質が変わる前提で使い方を見直す必要があります。

米政府が超知能分野の政策を調整する新組織を立ち上げました。率いるのは国家情報長官、FTC委員長、戦争省CTO、人事管理局長の4人で、官民や業界団体との窓口も担います。TechCrunchは、AI安全性をめぐる議論への政権の回答であり、AIのイメージを塗り替える狙いもあると論じています。米国のAI規制の方向は日本企業の調達や海外展開にも響くため、今後の動きを追う価値があります。

Googleは、AIで作られた報告の急増を理由に、オープンソース向けのバグ報奨金プログラムを凍結しました。検証に値しない低品質な報告が審査側の処理能力を超えたとみられます。AIによる脆弱性探索が広がるほど、報告を受ける側の選別コストも増えるという問題が表に出た事例です。

OpenAPPAは、プロンプトインジェクションやモデルの幻覚が原因で起きるデータの外部流出を止めるためのセキュリティエンジンです。開発元のArchestraによると、Bench-CorpとAgentThreatBenchでは攻撃成功率が0%でした。同社は比較対象としてClaude Codeのauto modeが10%、Microsoft FIDESが31%だったとしています。数値はいずれも開発元が測ったものですが、社内データに触れるエージェントを動かすときの防御層の候補になります。

AWS系のエージェントフレームワークStrands Agentsが、判断に特化した2Bパラメータのオープンソースモデルを発表しました。Zennには公式ブログの日本語訳が掲載されています。エージェントの分岐判断のような軽い処理を大型LLMから切り離せれば、レイテンシと費用を下げられます。

国内44社の出資を受けて、国産AI開発を掲げるNoetraが動き出しました。政府が5年間で1兆円規模を支援する可能性もあり、米中の二強に対する「第三極」を目指すとしています。日本語や国内向けのモデルの選択肢が増えるかどうかは、この取り組みが成果を出せるかにかかっています。

Anthropicは「Code execution with MCP」で、ツールを直接呼ぶ代わりにエージェントにコードを書かせればトークンを98.7%減らせた事例を示しました。ただしこの数字は、議事録をまるごと別サービスへ移すという特定のタスクで出たものです。筆者は複数顧客の注文集計という地味なタスクで両方式を比べ、どこまで削減効果が再現するかを数えています。MCPを使ったエージェントを組むときに、どちらの方式を選ぶかの判断材料になります。

約30の発信をエージェントに任せている筆者は、失敗が出るたびに規則を1つ足して直していました。その直し方を、Anthropicのeval設計の記事にならい、6つの場面で問題をtrainとtestに分けて測り直しています。分かったのは、失敗例をそのまま継ぎ足すと評価に過剰適合することです。プロンプトを直す前に失敗を原因別に分ける手順が具体的に書かれており、すぐ試せます。

MLflow 3.16.0から、LLMのトレース詳細画面をAI Assistantへの指示で作り替えられるようになりました。標準の画面は、スパンのツリーをたどって入出力を一つずつ確認する作りです。新機能を使えば「質問と最終回答」「各ツールの結果」のように見たい項目だけを並べた画面にできます。RAGやエージェントのログを人がレビューする時間を減らせます。

Pizza Botは自前のサーバーで動かすアプリで、エージェントがバックグラウンドで処理した結果を受信箱の形で受け取れます。定期実行やWebhookをきっかけにタスクを走らせ、専門のワーカーへ振り分け、必要な場面では人の承認を待って止まります。社内で非同期のエージェント運用を組むときの参考実装になります。

Epoch AIの総合指標ECIと、10月4日時点のAPI定価を使って、主要23モデルを散布図にまとめた記事です。筆者の集計では、ECI首位のモデルの料金は2位の約半額でした。首位の5%の料金で使えるモデルとの差もECIで13ポイントにとどまります。指標はあくまでECIなので、自分のタスクで確かめる前の候補選びに使うのが向いています。

AIが作ったボットと人間が作ったボットを戦わせるStarSkirmishでは、GPT-6 AstraとClaude Opus 5.5のボットがAI製の中で首位を争っていました。それでも人間製のトップボット「Stardust」には届いていません。Kotakuの報道によると、対戦中にAI側が不正な手段を使う場面がありました。目的を与えられたモデルが想定外の近道をとる、いわゆる報酬ハッキングの身近な例です。
