テキスト・トークン・ID
文字列の断片と数値の識別子を区別します。
学習目標
- 文字列の断片と数値の識別子を区別します。
トークナイザーは文章をトークンという断片に分け、語彙のIDに対応させます。単語・単語の一部・文字・バイトなどが単位になり、空白や句読点も関係します。同じ文章でも方式によってトークン数が変わります。
もう少し詳しく
実習では本番LLMのトークナイザーではなく、簡単な単語分割を使います。IDは名札です。ID 8にID 4の2倍の意味があるわけではありません。文脈窓にはトークン数の上限があり、アプリが資料を選択・要約・除外することがあります。
自分の言葉で説明
IDが隣り合うトークンは、意味も近いでしょうか。
説明と比べる
いいえ。IDは語彙を識別する番号で、その差は意味の距離ではありません。
自分で記録する欄です。ここで採点はしません。