LLM・基盤モデル

LLM・基盤モデル

研究AIは、特権的な道具から共有インフラへ向かう

Accelerating scientific discovery with ChatGPT for Academic Researchers は、OpenAI が研究者向けに ChatGPT の高度なモデルを無償提供するプログラムを発表し...
LLM・基盤モデル

AIエージェントの実力は、設定込みで測るべき段階に入った

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark は、GPT-5.6 Sol の ARC-AGI-3 成績が API 設定によって大きく変わったこ...
LLM・基盤モデル

Managed Agents は「任せるAI」から「制御できるAI」へ進む

What’s new in Managed Agents in Gemini API は、Gemini API の Managed Agents が Gemini 3.6 Flash を標準モデルにしたことを発表しました。あわせて、sand...
LLM・基盤モデル

Flash系モデルは、AIエージェント運用の前提を変えるか

Google DeepMind は 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber を発表しました。3.6 Flash は、3.5 Flash 比で出力トークン使用量を17%削減したワークホース...
LLM・基盤モデル

AIは仕事を奪う前に、職務の境界を動かしている

AIの影響は、雇用が増えるか減るかだけでは測れません。先に変わり始めているのは、誰がどの仕事を引き受けるかという境界です。OpenAIのHow AI is expanding what people do at workは、米国のChatG...
LLM・基盤モデル

Computer use は、エージェント開発を特別扱いから日常の実装へ移す

Google DeepMind は 2026年6月24日、Introducing computer use in Gemini 3.5 Flash を公開しました。Gemini 3.5 Flash に computer use が組み込みツ...
LLM・基盤モデル

Opus 5 が問うのは、最強モデルではなく日常モデルの基準です

Introducing Claude Opus 5 で Anthropic は、Claude Opus 5 を 2026年7月24日に提供開始したと発表しました。同社は、Opus 5 がコーディングや知識労働の評価で高い性能を示し、Fabl...
LLM・基盤モデル

健康AIの価値は、回答の精度だけでは決まらない

Launching Health in ChatGPT で、OpenAI は米国の対象ユーザー向けに Health in ChatGPT を提供開始したと発表しました。Apple Health や対応する医療記録を接続し、検査結果、服薬、睡...
LLM・基盤モデル

AI活用の議論は、ようやく職種別に聞ける段階へ進む

The Anthropic Economic Index connector \ Anthropic は、Anthropic Economic Index のデータを Claude 上で直接たずねられるコネクタを発表したものです。Index...
LLM・基盤モデル

Codexの価値は、開発支援から業務委任へ移り始めた

AI導入の成果は、チャットの利用率ではなく、どこまで仕事を任せられるかで測られる段階に入っています。OpenAIの事例記事 NTT DATA Group cuts incident analysis to 30 minutes with C...