コラム

コラム

【週刊 AI 懐疑論 #3】AIに「正しい」と言えるのは、誰か

週刊 AI 懐疑論、第3回。今週取り上げたいのは、異なる三つの領域から届いた「AI活用の現場報告」だ。IT開発の現場、クリエイティブ業界、そして薬学・医療の実務者。分野も文脈も異なる。だが横並びにして読むと、共通する構造が浮かび上がってくる...
コラム

「任せた」の先に見えるもの ─ AIエージェント実地観察記 第2話

前回の話では、AIエージェントを初めて実務に組み込んだときの違和感を書いた。今回は、その後しばらく使い続けて気づいたことを書く。エージェントに慣れてくると、面白いことが起きる。最初は「どこまでやってくれるんだろう」と恐る恐る委ねていたのが、...
コラム

「AI効果が出ています」を誰も検証しない問題

生成AIの「導入事例」が増え続けている。業務効率化、コスト削減、生産性向上——そうした成果が、各社の発表やメディアを通じて積み上がっていく。だが立ち止まって考えると、それらの多くは「体感として速くなった」「以前より楽になった」という感想に近...
コラム

「賢くなった」を誰が決めているか

週次でモデルリリースが積み重なるようになって久しい。「過去最高のスコアを達成」「推論能力が大幅に向上」という発表が届くたびに、一つ確認したくなることがある。その評価は、誰がやったのか、と。自己採点の構造生成AIの性能評価において、開発者が評...
コラム

スコアが高くても「使えない」の正体

OpenAIがo3を発表したとき、ベンチマーク数字のインパクトは並外れていた。ARC-AGIで87.5%、GPQAダイヤモンドで87.7%、AIME 2024では96.7%——どの指標も、人間のトップパフォーマンスを射程に入れる水準だった。...