生成AI

コラム

「賢くなった」を誰が決めているか

週次でモデルリリースが積み重なるようになって久しい。「過去最高のスコアを達成」「推論能力が大幅に向上」という発表が届くたびに、一つ確認したくなることがある。その評価は、誰がやったのか、と。自己採点の構造生成AIの性能評価において、開発者が評...
コラム

スコアが高くても「使えない」の正体

OpenAIがo3を発表したとき、ベンチマーク数字のインパクトは並外れていた。ARC-AGIで87.5%、GPQAダイヤモンドで87.7%、AIME 2024では96.7%——どの指標も、人間のトップパフォーマンスを射程に入れる水準だった。...
生成AI

スコアが伸びるほど、見えなくなるもの

ベンチマークは何を測っているかまず、事実を認めるところから始める。ここ数年で主要な言語モデルのベンチマークスコアは大きく伸びた。MMLU、HumanEval、GSM8K──どの指標を取っても、2022年から2025年にかけての上昇幅は目を見...
生成AI

AIコーディング支援の生産性研究が測っていないもの

「Copilotを使うと開発速度が55%向上する」という数字を、一度は目にしたことがあるはずだ。GitHubが2022年に発表した調査結果で、以来この数字はAIコーディング支援ツール導入の根拠として営業資料や技術記事に広く引用されている。こ...
生成AI

週刊AI懐疑論 #1|「生産性55%向上」は何を測ったのか

何が「生産性」なのかを問わずに、数字を受け取っている「AIコーディングアシスタントで生産性が55%向上した」GitHubが2022年に発表したこの数字は、その後のAI開発ツール議論のベースラインになった。McKinsey、Deloitte、...
生成AI

複数視点の統合は、記事品質をどう変えるのか

記事生成AIが直面する構造的な課題がある。単一視点に依存すると、精密なプロンプト調整をしても、一度に一つの角度からしか問題を照らすことができない。特に論争的なテーマや判断が分かれるトレンドでは、この限界が顕著だ。author パイプラインが...
生成AI

複数視点の『自動統合』は、記事品質を高めるか

メディアの品質を高めるには、複数の視点からテーマを検証する必要がある。推進・拡張・批判など異なる立場から同時に論点を分析することで、単一視点では見落とされた論点が浮かぶ。従来、この多角的な検証は手作業による確認を前提としていた。author...
生成AI

「補助ツール」を超えた AIエージェント——協働設計が実務者の差分になる

Claude Code がコードを書き、Devin が Issue を自律的に処理し、Cursor がリファクタリング提案を出す。生成AI は「使えると便利なツール」から、開発フローの構造そのものを変える存在へと移行しつつある。変化のドライ...
生成AI

AIエージェント過大評価の正体は“運用軽視”だ──週刊AI懐疑論

AIエージェントは「人手を減らす切り札」として語られがちです。ですが現場の肌感では、期待値だけが先に走っている案件も少なくありません。週刊 AI 懐疑論の今回は、過剰期待の中心にある誤解を1つに絞って扱います。エージェントの失敗はモデル精度...
生成AI

AIエージェント実地観察記 #2 ツール呼び出しは“運転設計”で決まる

「AIエージェントは仕事を自律で回してくれる」という説明は、半分だけ正しいです。実地で観察すると、エージェントの本体は“賢い返答”ではなく、ツール呼び出しを何周も安全に回す実行ループにあります。連載第2話では、ツール呼び出しの実像を整理しま...