벡터와 임베딩
ID·원-핫 벡터·학습된 임베딩을 구분해요.
학습 목표
- ID·원-핫 벡터·학습된 임베딩을 구분해요.
ID는 이름표이고 벡터는 숫자의 목록이에요. 원-핫 벡터는 어휘의 한 자리만 1, 나머지는 0으로 표시하므로 의미의 유사성을 담지 않아요. 임베딩은 학습된 벡터예요. 데이터와 학습 목표에 따라 관련된 쓰임이 가까운 위치에 놓일 수 있어요.
조금 더 알아보기
현대 Transformer는 attention으로 주어진 문맥의 위치별 정보를 섞어서, 같은 토큰도 문장에 따라 표현이 달라져요. 유사도는 진실이나 같은 뜻을 보장하지 않아요. 유명한 왕 − 남자 + 여자 비유는 일부 단어 임베딩에서 관찰된 예이지 보편적인 등식이 아니에요. 검색에서는 질문과 문서 벡터를 호환되는 임베딩 공간에서 비교해요.
내 말로 설명해 보기
가까운 임베딩이면 두 문장이 같은 참말이라는 증거일까요?
설명과 비교하기
아니요. 같은 주제로 정반대 주장을 할 수도 있어요. 실제 내용을 읽고 검증해야 해요.
스스로 표시하는 칸이에요. 여기서 채점하지는 않아요.