文字数・バイト数からのトークン数推定は実際どれくらいズレるのか
- LLMのトークン数推定は文字数・バイト数・tiktoken・llm-jp-3で実測値を下回る
- 日本語では文字数ベースが平均-122トークン、llm-jp-3はtiktokenより3倍近く外れる、CountTokensは全カテゴリで+16トークン
- 事前バリデーションで文字数・バイト数ベースやtiktokenは過小評価のリスクがあるため避けるべき、CountTokensは安全マージンを考慮して使うのが現実的
文字数・バイト数からのトークン数推定は実際どれくらいズレるのか


