Scraps 最終更新 2026/09/18 20:03

原文著者: @nishina /

文字数・バイト数からのトークン数推定は実際どれくらいズレるのか

  • #生成AI・LLM
  • #AIエージェント
  • #機械学習

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • LLMのトークン数推定は文字数・バイト数・tiktoken・llm-jp-3で実測値を下回る
  • 日本語では文字数ベースが平均-122トークン、llm-jp-3はtiktokenより3倍近く外れる、CountTokensは全カテゴリで+16トークン
  • 事前バリデーションで文字数・バイト数ベースやtiktokenは過小評価のリスクがあるため避けるべき、CountTokensは安全マージンを考慮して使うのが現実的
文字数・バイト数からのトークン数推定は実際どれくらいズレるのか

Zenn / 原文を読む