【とーくん】
トークン(AI) とは?
最終更新:
💡 言語モデルが文章を処理する単位。文字や単語と同じとは限らない
言語モデルがテキストを処理するために使う単位。単語、単語の一部、文字などに分かれ、分割方法と数はtokenizer(分割処理)によって異なる。文字数や単語数と常に一致するものではない。
📌 このページのポイント
- 文章をtokenizer(分割処理)で分割し、語彙表のIDへ変換して扱う
- 英語も単語の一部に分かれることがあり、言語別の固定倍率はない
- APIでは料金や利用上限を管理するための基準になることがある
- 数えるときは利用するモデルの方式と、実際に送る入力をそろえる
AIのトークンは、文字と同じ?
同じとは限らないよ。単語全体、単語の一部、文字などに分けて処理する単位なんだ。英語でも一つの単語が複数に分かれることがある。日本語でも、常に1文字が1トークンという決まりではないよ
どうやって分けて使うの?
tokenizer(分割処理)が文章を分割し、語彙表に対応するIDの列へ変換するよ。分け方は方式や語彙表で変わる。例えばannoyinglyは、annoyingとly、あるいはannoy・ing・lyに分かれる例がある。これは分割例で、どのモデルでも同じになるという意味ではないんだ
多いと、必ず料金も時間も増える?
日本語は英語の何倍になるの?
コンテキストの上限はどう考える?
一度に扱える範囲を、トークン数で示すものだよ。モデルやサービスの規則に従い、会話履歴、指示、ツール結果、これから生成する回答などを考慮する。文字数や本の冊数への換算は一定ではないし、枠に収まることと回答が正確であることも別だよ
まとめ:ざっくりこれだけ覚えればOK!
「トークン(AI)」って出てきたら「言語モデルが文章を分割して処理する単位」と思えばだいたいOK!
📖 おまけ:英語の意味
「Token」 = ここでは、言語モデルが処理するテキストの単位
💬 分割には単語単位、文字単位、単語の一部を使う方式などがあるよ。多くの言語モデルではサブワードという、単語より小さな部分を使う方式が採用されているんだ