AI는 생명체가 아니라 사람이 만든 소프트웨어예요. 예측·인식·검색·생성을 위한 여러 방법을 포함해요. 이 수업에서는 토큰을 하나씩 이어 글을 만드는 자기회귀 언어모델을 살펴봐요.
기술 문헌에서는 그럴듯하지만 틀리거나 근거가 없는 일부 출력을 환각이라고 불러요. 출력의 문제를 가리키는 용어이지 프로그램에 마음이 있거나 사람이 겪는 환각을 경험한다는 뜻은 아니에요. 기계를 의인화하지 않으면서도 출력 오류를 찾아 고칠 수 있어요.
추론 모드는 답을 내기 전에 중간 단계·탐색·검증에 더 많은 계산을 쓸 수 있어요. 일부 과제에 도움이 되지만 정답을 보장하지 않아요. ‘생각 중’ 같은 제품 표시는 인간과 같은 의식 경험의 증거가 아니에요.
우리는 작은 단어 바이그램 모형을 만들 거예요. 한 단어 다음에 나오는 횟수를 세어 확률로 바꿔요. 조건부 예측을 눈으로 볼 수 있지만 현대 신경망 언어모델 전체 알고리즘은 아닌 수업용 모형이에요.
신경망 언어모델은 학습 예제에서 숫자 가중치를 배워요. 생성할 때는 가중치와 주어진 문맥으로 후보 토큰 점수를 계산해요. 인터넷 문장을 그대로 찾아 꺼내거나 바로 앞 단어의 횟수만 세는 방식은 아니에요.
가상의 분포를 생각해 봐요. 파랑 70%, 회색 20%, 주황 10%로 합계는 100%예요. 실제 AI 서비스를 측정한 수치가 아닌 설명용 예시예요. 샘플링은 확률대로 추첨하고, 이 고정 예시의 탐욕 선택은 최고 확률 후보를 골라요.
샘플링은 다른 답을 만들 수도, 같은 답을 반복할 수도 있어요. 작은 양수 온도는 분포를 집중시키지만 사실을 더 참으로 만들지 않아요. 실제 시스템은 문맥·모델 버전·도구·수치 실행도 결과에 영향을 주므로 온도 0도 완전히 같은 출력을 약속하지 않아요.
자연스럽거나 확률이 높은 답이 반드시 참은 아니에요. 모델은 근거 없는 주장도 자신 있는 말투로 만들 수 있어요. 유창함을 증거로 삼지 말고, 어떤 근거가 주장을 뒷받침하는지 확인하세요.
확률은 선택을 설명하고, 증거는 사실 주장을 뒷받침해요. 두 역할을 구분하세요.
AI에 인간의 감정이나 의도를 가정하지 말고 도구로 다루세요. 시스템을 적절히 설계하고 사용하는 책임은 사람에게 있어요. 모델의 한계를 찾으면 더 나은 도구와 검증 방법을 고를 수 있어요. 기계에 대한 도덕적 판단은 아니에요.
잘못된 출력은 모델 한계·학습 데이터·문맥 부족·낡은 검색 자료·소프트웨어 결함 등에서 나올 수 있어요. 명확한 질문은 도움이 되지만 정답을 보장하지 않아요. 학습자 탓으로 돌리거나 한 번 더 물으면 모두 해결된다고 생각하기 전에 원인을 확인하세요.
학습은 가중치를 바꾸고, 모델을 사용하는 것은 추론이에요. 프롬프트에 문서를 넣으면 문맥이 바뀌지만 반드시 가중치가 바뀌는 것은 아니에요. 검색으로 유용한 출처를 가져올 수 있어도 그 자료와 생성된 주장을 확인해야 해요.
답에서 주장 하나를 골라 원출처의 날짜·문맥·실제 내용을 확인하세요. 가능하면 숫자를 다시 계산하거나 적절한 테스트를 실행하세요. 힌트를 받은 뒤 확인한 결과를 자기 말로 설명해 보세요.
첫 실험이에요. 한 단어 뒤에 후보 A가 세 번, B가 한 번 나왔다면 각각의 확률은 얼마일까요? 만들기를 열기 전에 예상하고, 탐욕 선택과 반복 추첨을 비교해 보세요.
작은 모델을 만들고 한계를 관찰한 뒤 배운 내용을 확인해요. 작동 원리를 이해하는 것은 AI를 잘 활용하기 위한 한 걸음이에요.