契約書のレビューや修正は、専門知識と細かな画面操作が重なる仕事です。AIエージェントがこの領域で使えるようになれば、「専門職の仕事を任せられるか」という問いに一歩近づきます。
元記事の要点
OpenAIのAdvancing computer use with Ironcladは、OpenAIと契約業務ソフトのIroncladが、複雑な契約ワークフローでAIエージェントを訓練・評価している取り組みを紹介しています。目的は、専門業務における「コンピュータ操作(computer use)」の能力を高めることです。
(注:本稿は公開されている概要をもとに書いています。具体的な数値や手法は原文でご確認ください。)
汎用デモから、業務に根ざした訓練へ
これまでのコンピュータ操作は、汎用的なタスクで能力を示す段階が中心でした。今回の取り組みは、実際の契約業務という具体的な現場を訓練と評価の舞台に据えています。
契約業務は、条項の確認、承認の流れ、複数のシステムをまたぐ操作など、手順の多い仕事です。ここで「どこまで正しくこなせたか」を測れるようになると、エージェントの性能を業務の言葉で語れるようになります。
機会はどこにあるか
1つ目は評価の現実味です。実務に近いワークフローで評価できれば、導入側は「自社の業務で使えるか」を判断しやすくなります。
2つ目は業務ソフト側の役割です。業務の流れや品質基準を知るベンダーが開発側と組むことで、現場が求める精度を訓練に反映しやすくなります。
3つ目は、専門職の時間の使い方です。定型的な確認作業をエージェントが担えば、人は交渉や例外判断といった、責任を伴う判断に集中できるようになります。
判断のヒント
自社でエージェント導入を考えるなら、デモの印象よりも「自分たちの業務フローで評価されているか」を見るのが近道です。契約に限らず、手順が明確で成否を判定しやすい業務ほど、エージェントの導入先として有望です。まずは小さな範囲で試し、評価基準を自社で持つことから始められます。
出典:Advancing computer use with Ironclad(OpenAI)
関連記事
- Sharing AI progress in mathematics
- How Jump Trading is scaling quant research with ChatGPT
- Falcon-Emirati: When an LLM Learns the Dialect, the Culture, and the Nuance
参考文献
コメント