AIエージェント

AIエージェント

AIエージェントの安全性は、モデルの性格だけでは守れない

AIエージェントを業務に入れるとき、最初に問うべきなのは「このモデルは賢いか」ではなく、「失敗しても止められる構造になっているか」です。Google DeepMind は Securing internal systems against ...
AIエージェント

エージェントの性能差は、検索層で決まり始めている

AIエージェントの改善というと、つい推論モデルの性能に目が向きます。けれど、実運用で効いてくるのは「どの文脈を、どれだけ早く渡せるか」です。NVIDIA は Hugging Face Blog で NVIDIA Nemotron 3 Emb...
AIエージェント

AIエージェントは会話を処理するだけでは足りない

OpenAIの事例記事 How Cars24 scales conversations and builds faster with OpenAI では、Cars24が音声・チャットエージェントで月100万分超の会話を処理していると紹介され...
AIエージェント

AIエージェントの信頼性は、モデル選定だけでは決まらない

What building Shippy taught us about building agents は、Ai2 が海洋監視向けAIエージェント Shippy を構築した経験を紹介した記事です。Shippy は Skylight のライ...
AIエージェント

AI投資は「利用量」から「成果単価」へ移る

AIエージェントへの投資で難しいのは、使われているほど価値が出ているとは限らない点です。チャット利用の延長で予算を見るだけでは、探索、浪費、事業上重要なワークフローの芽を見分けにくくなります。OpenAI は How to manage A...
AIエージェント

エージェントの安全性は、単体評価だけでは足りなくなる

Google DeepMind and partners announce multi-agent safety research funding call. — Google DeepMind は、Google DeepMind などが最...
AIエージェント

AIコードレビューは「何を読まないか」で良くなる

AIエージェントの性能は、強いツールを渡せば自然に上がるのでしょうか。GitHub の事例は、その答えがかなり条件付きであることを示しています。Better tools made Copilot code review worse. Her...
AIエージェント

物理AIで問われるのは、モデル性能より工程への入り方

UST is bringing Claude to physical AI は、Anthropic と UST の提携を紹介しています。UST は半導体、車載、製造、通信、IoT などの工程に Claude を組み込み、世界で 2万人の技術...
AIエージェント

エージェント開発の差は、モデルよりデータ設計に移りつつある

Hugging Face の Data for Agents は、AI エージェントに必要なのはモデル重みだけではなく、ツール利用・失敗回復・ワークフロー実行を含むデータだと指摘しています。NVIDIA は Nemotron 系のオープンデ...
AIエージェント

ドキュメント作成は、実装後の作業からPR直後の判断へ移る

機能がマージされたあと、ドキュメント担当者が差分を読み解き、実装者に確認し、遅れて公開する。この流れは多くの開発組織で見慣れたものですが、AIエージェントが入り込む余地が大きいのは、まさにこの「翻訳待ち」の時間です。GitHub Blogの...