텍스트·토큰·ID
텍스트 조각과 그 조각의 숫자 식별자를 구분해요.
학습 목표
- 텍스트 조각과 그 조각의 숫자 식별자를 구분해요.
토크나이저는 텍스트를 토큰이라는 조각으로 나누고, 어휘 사전의 ID에 대응시켜요. 토큰은 단어·단어 일부·글자·바이트일 수 있으며 공백과 문장부호도 중요해요. 같은 글도 토크나이저에 따라 토큰 수가 달라져요.
조금 더 알아보기
실습실은 실제 LLM 토크나이저가 아닌 간단한 단어 분할기를 써요. ID는 이름표이므로 ID 8이 ID 4보다 뜻이 두 배인 것은 아니에요. 문맥 창에는 사용할 수 있는 토큰 수의 한계가 있어 앱이 자료를 선택·요약·제외할 수 있어요.
내 말로 설명해 보기
두 토큰의 ID가 연속된 숫자이면 뜻도 비슷할까요?
설명과 비교하기
아니요. ID는 어휘를 식별할 뿐, 숫자의 거리가 의미의 거리는 아니에요.
스스로 표시하는 칸이에요. 여기서 채점하지는 않아요.