AIの推論が遅いとき、真っ先に疑うのはGPUです。でも、GPUの前で待たされているのが実はCPU側の地味な文字処理だったとしたら、話は変わってきます。
Hugging Faceが公開したtokenizers v1: encode, decode and scaling, measuredは、トークナイザーライブラリの新バージョンについての記事です。要点は、旧バージョン(v0.23)比で処理速度が場面によって数十倍向上したこと、GPUがCPU側のトークン化待ちで遊んでしまう状態の解消を目標に設計されたこと、そしてgigatokenやtiktokenなど周辺OSSの知見を積極的に取り込んで実現された点です。
これまでトークン化は、モデル本体の計算に比べて軽い処理だとみなされ、インフラ設計上はほとんど意識されてきませんでした。ところが長文コンテキストを扱うRAGパイプラインや、同時に大量のリクエストをさばく推論サーバーのような環境では、この「軽いはずの処理」が積み重なってボトルネックに変わります。GPUを増強しても、手前のトークン化が詰まっていれば意味がありません。
ここが今回の転換点です。以前は、トークン化のボトルネックに対して現場ができることは限られていて、GPUを多めに積んで待ち時間を吸収するのが実質的な対処法でした。tokenizers v1が示すのは、その手前の工程自体を速くすることで、ハードウェアを増やさずにスループットを底上げできるという道筋です。これは、長文処理やマルチテナントで同時多発的にリクエストを処理するチームにとって、コストを掛けずに詰まりを解消できる余地が生まれたことを意味します。
冒頭の問いに戻ると、答えは「少なくともこの一段については、待たせる理由がひとつ減った」です。スケールを検討している人ほど、これまで見えていなかったトークナイザーの処理時間を一度測ってみる価値があります。
関連記事
- How to Use NVIDIA Warp and MjWarp to Accelerate Robotics Simulation and Learning Workflows
- AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
- Rethinking security for the age of AI
参考文献
コメント