LLM・基盤モデル

LLM・基盤モデル

GPT-6 Astraで問われるのは、モデル性能ではなく委任の設計です

OpenAI は GPT-6 Astra: A new generation of intelligence で、GPT-6 Astra を「最も知的で整合性の高いモデル」として発表しました。要点は、コンピュータ操作、コーディング、サイバー...
LLM・基盤モデル

GPT-6 Astraで問われる、安全性を前提にしたAI導入

Safety overview: GPT-6 Astra は、OpenAIがGPT-6 Astraの安全性評価と配備上の対策を説明した記事です。Astraは広く提供されるモデルとして同社最高性能であり、Preparedness Framew...
LLM・基盤モデル

ゲーム試作の価値は、生成速度から比較回数へ移り始める

Playco cut manual fixes 50% prototyping games with GPT-6 Astra では、Playco が GPT-6 Astra を使い、1つのグレーボックス基盤から3種類のテーマ付きゲーム試作を...
LLM・基盤モデル

専門家の判断は、AIの後に置かれる

大量の文書を読む力は、AI活用の見た目としては分かりやすい成果です。ただ、今回の論点は「速く読めた」ことだけではありません。専門職の仕事でAIを使うとき、どこまでを機械に渡し、どこからを人間の判断として残すのか。その境界が、かなり具体的に見...
LLM・基盤モデル

Flashモデルは、低コスト化ではなく実行単位の変化を示している

Google DeepMind は Introducing Gemini 3.8 Flash and 3.8 Flash Cyber で、Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を発表しました。要...
LLM・基盤モデル

小さなチームのAI活用は、作業短縮より業務の見える化を変える

OpenAI の事例記事 ATV Big Air Tour turned 3 days of work into 3 hours with ChatGPT では、2人で全米26イベントを運営する ATV Big Air Tour が、Cha...
LLM・基盤モデル

AI導入は、利用率より統治設計で決まる

How law firm Gilbert + Tobin governs and scales AI with OpenAI は、オーストラリアの法律事務所 Gilbert + Tobin が ChatGPT Enterprise と Co...
LLM・基盤モデル

ベンチマークの点数は、何の能力を映しているのか

BenchMIRT: What are LLM benchmarks actually measuring? は、LLM ベンチマークを個々の設問レベルで監査する手法 BenchMIRT を紹介しています。100のオープンウェイト LLM、...
LLM・基盤モデル

動画AIの進化は、長尺コンテンツを「全部読む」発想から離れ始めた

Introducing Agentic Video in Gemini で Google DeepMind は、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 向けに agentic video unde...
LLM・基盤モデル

医療AIの価値は、モデル単体から接続設計へ移り始めた

OpenAI は Healthcare organizations can now connect EHR and additional industry data to ChatGPT を発表しました。要点は、ChatGPT for He...