가입하면 어디까지 배웠는지 기억해 드려요.
요청이 가는 길
도구를 선택적으로 사용하는 클라우드 텍스트 도우미의 대표 경로예요. 로컬·멀티모달 모델과 제공자에 따라 경로가 달라지며 번호는 이를 단순화한 설명이에요.
큰 그림 — 다섯 군데
- 내 컴퓨터
- 네트워크
- 멀리 있는 기계
내 컴퓨터의 프로그램
챗봇·코딩 에디터·앱. 내 요청을 받아서 무엇을 보낼지 정합니다.
네트워크
인터넷을 건너는 길. 이 길로 오가는 것은 글과 파일뿐입니다.
멀리 있는 계산 기계
런타임이 모델 파일을 읽고 추론해요. 준비된 워커는 보통 가중치를 재사용하지만 콜드 스타트·퇴거·오프로딩·재시작 때 다시 읽을 수 있어요. 모델을 여러 장치나 서버에 나누기도 해요.
계산 모델
신경망 언어모델은 학습 예제에서 숫자 가중치를 배워요. 생성할 때는 가중치와 주어진 문맥으로 후보 토큰 점수를 계산해요. 인터넷 문장을 그대로 찾아 꺼내거나 바로 앞 단어의 횟수만 세는 방식은 아니에요.
다시 내 컴퓨터
프로그램이 답을 보여 주고, 내가 허락했을 때만 일을 합니다.
1번과 5번은 같은 내 컴퓨터예요
3번 칸을 열어 보면
- 디스크에 잠들어 있는 커다란 숫자 파일. 그 파일이 곧 모델입니다.
- 런타임이 그것을 읽어 계산 전용 부품 위에 올려 두고, 그대로 켜 둡니다.
- 문지기가 열쇠를 확인하고, 요청은 차례를 기다립니다.
- 이미 올라가 있는 그 숫자로 계산이 돌아갑니다.
한 단계씩
여덟 단계입니다. 여덟 번째에서 길이 둘로 갈립니다.
내가 보냅니다
음성 인식으로 글자를 만든 뒤 텍스트 모델에 보낼 수 있어요. 음성을 직접 받는 모델도 있어요. 마이크 권한과 선택한 서비스에 따라 처리 위치가 달라져요.
프로그램이 가방을 쌉니다
앱이 문맥 한도 안에서 메시지·지시·허용된 첨부를 선택해요. 이전 내용을 자르거나 요약하거나 검색할 수 있어요. 빠진 내용을 자동으로 기억하지 않으며 요약도 정보를 잃을 수 있어요.
인터넷을 건넙니다
HTTPS는 연결을 암호화해요. HTTP/1.1·2는 보통 TCP와 TLS를, HTTP/3는 QUIC을 써요. 실시간 서비스는 WebSocket·WebRTC도 써요. 그림은 연결의 역할을 보여주며 한 방식만 강제하지 않아요.
계산 기계가 받습니다
런타임이 모델 파일을 읽고 추론해요. 준비된 워커는 보통 가중치를 재사용하지만 콜드 스타트·퇴거·오프로딩·재시작 때 다시 읽을 수 있어요. 모델을 여러 장치나 서버에 나누기도 해요.
다음 토큰을 뽑습니다
샘플링은 다른 답을 만들 수도, 같은 답을 반복할 수도 있어요. 작은 양수 온도는 분포를 집중시키지만 사실을 더 참으로 만들지 않아요. 실제 시스템은 문맥·모델 버전·도구·수치 실행도 결과에 영향을 주므로 온도 0도 완전히 같은 출력을 약속하지 않아요.
토큰마다 이 단계로 되돌아옴
나오는 대로 돌려보냅니다
텍스트는 SSE 등으로 조각씩 전달할 수 있어요. 음성이나 일부 이미지·영상 시스템도 스트리밍하며 완성 파일을 보내는 서비스도 있어요. 조각 크기와 시점은 서비스 방식이며 사람이 타이핑하거나 생각한다는 증거가 아니에요.
프로그램이 화면에 뿌립니다
텍스트는 SSE 등으로 조각씩 전달할 수 있어요. 음성이나 일부 이미지·영상 시스템도 스트리밍하며 완성 파일을 보내는 서비스도 있어요. 조각 크기와 시점은 서비스 방식이며 사람이 타이핑하거나 생각한다는 증거가 아니에요.
길은 하나가 아니라 둘입니다
이 둘을 한 줄기로 그리는 데서 무서운 오해가 생깁니다. 둘은 같지 않습니다.
대화만
- 화면에 글자
- 여기서 끝
자세히 보기
글자가 화면에 흐르고 그것으로 끝납니다. 내 컴퓨터에는 아무 일도 일어나지 않습니다. 이 사이트의 라리아 학습 도우미가 이 길입니다.
손을 빌림
- 도구 요청 찾아내기
- 허락 묻기
- 실제로 하기
- 결과 담기
결과는 2단계 가방에 담겨 3단계로 다시 나갑니다
자세히 보기
모델이 구조화된 도구 호출을 제안하면 앱이 검증하고 권한 안에서 로컬이나 원격 서비스에서 실행해요. 결과를 모델에 다시 보낼 수 있어요. 횟수 제한·취소·실패로 반복이 멈출 수도 있어요.
권한·격리·검증·필요한 승인은 앱이나 서비스가 강제해야 해요. 시스템 프롬프트만으로 보안 경계가 되지는 않아요. 미리 허용한 작업은 다시 묻지 않을 수 있고 구현이 잘못되면 통제가 실패할 수 있어요.
굳이 비유하자면
-
몸 하나가 계산 부품을 갈아 끼웁니다. 같은 코딩 에디터에 내일은 다른 회사의 모델을 달 수 있습니다.
-
같은 계산 부품이 서로 모르는 수많은 사람의 요청을 동시에 처리합니다. 살아 있는 것이라면 있을 수 없는 일입니다.
자세히 보기
모델이 구조화된 도구 호출을 제안하면 앱이 검증하고 권한 안에서 로컬이나 원격 서비스에서 실행해요. 결과를 모델에 다시 보낼 수 있어요. 횟수 제한·취소·실패로 반복이 멈출 수도 있어요.
두 가지만 더
계산 기계가 늘 멀리 있는 것은 아닙니다
지금 이 사이트가 바로 그 그림입니다
| 1 · 내 프로그램 | 2 · 네트워크 | 3 · 원격 기계 | 4 · 계산 모델 | 5 · 내 화면 | |
|---|---|---|---|---|---|
| 내 브라우저 안에서 | 예 | 아니요 | 아니요 | 예 | 예 |
| 우리 서버를 거쳐서 | 예 | 예 | 예 | 예 | 예 |
| 멀리 있는 회사의 기계에서 | 예 | 예 | 예 | 예 | 예 |
가운데 길에서도 계산은 세 번째 길에서 일어납니다. 우리 서버가 하는 일은 확인하고 실어 나르는 것입니다.
자세히 보기
PES의 Supertonic 음성 합성은 모델 로딩 후 로컬에서 실행돼요. 브라우저 음성 서비스는 로컬·원격 음성을 쓸 수 있어요. 채팅은 별개로 PES를 거쳐 언어모델 서비스에 전달돼요.
라리아 학습 도우미를 열어 무엇이든 물어보세요. 브라우저가 우리 서버로 보내고, 우리 서버가 멀리 있는 계산 기계에 넘깁니다. 글자가 조각으로 돌아오는 것이 6단계, 그 글자가 화면에서 늘어나는 것이 7단계입니다. 라리아는 대화만 하는 길에 있어서, 내 컴퓨터의 파일에는 손을 대지 않습니다.
라리아 학습 도우미가 그렇습니다. 우리 서버는 요청을 넘겨줄 뿐, 모델을 돌리지는 않습니다.
계산이 실제로 일어나는 곳입니다. 그 안에서 어떤 런타임을 쓰는지는 공개돼 있지 않습니다.
어른을 위한 주석
조금 더 정확한 표현이 필요한 분을 위해 덧붙입니다.
토큰
토크나이저는 글 조각을 자기 어휘의 ID로 바꿔요. 조각은 단어·부분어·글자·바이트일 수 있어요. 같은 글도 토크나이저마다 ID와 토큰 수가 달라질 수 있어요.
스트리밍
만들어지는 대로 부분 출력을 밀어 보내며, 보통 SSE 를 씁니다. 조각의 크기는 제품마다 다릅니다 — 토큰 하나가 아니라 문장 단위로 보내는 것도 있습니다.
모델의 종류
LLM(큰 언어 모델), SLM(작은 언어 모델), VLM(그림까지 함께 보는 모델), 그리고 이미지·영상을 만드는 확산 모델이 있습니다. 만들어진 방식이 서로 다르고, 전부가 글을 내놓는 것도 아닙니다.
뽑는 방식
샘플링은 다른 답을 만들 수도, 같은 답을 반복할 수도 있어요. 작은 양수 온도는 분포를 집중시키지만 사실을 더 참으로 만들지 않아요. 실제 시스템은 문맥·모델 버전·도구·수치 실행도 결과에 영향을 주므로 온도 0도 완전히 같은 출력을 약속하지 않아요.
RAG · MCP · 스킬
도구는 앱 API나 MCP로 연결할 수 있어요. MCP는 로컬·원격 서버의 도구·리소스·프롬프트를 제공할 수 있어요. 사용 가능 여부는 모델 자체가 아니라 앱 설정과 권한으로 정해져요.
모델을 돌리는 프로그램(런타임)
이 사이트가 실제로 쓰는 것은 ONNX Runtime(음성 합성)과 sherpa-onnx(받아쓰기)입니다. 서버에서 큰 언어 모델을 돌릴 때는 같은 일을 하는 다른 프로그램들 — vLLM · TensorRT-LLM · llama.cpp 등 — 을 씁니다. 어느 회사가 무엇을 쓰는지는 공개돼 있지 않습니다.
숫자, 정밀도, 메모리 — 그리고 숫자를 움직이는 런타임
- 모델 파일 악보
- 런타임 지휘자
- CPU · GPU 연주자
| 잘하는 일 | |
|---|---|
| ONNX Runtime | 여러 종류의 모델을 여러 기기에서 |
| llama.cpp | 내 컴퓨터에서 LLM 실행 (GGUF) |
| FreeToken | 큰 MoE 모델을 개인 PC에서 |
자세히 보기
AI 모델은 학습으로 얻은 수많은 숫자와 계산 구조입니다. 런타임은 이 구조를 메모리에 올리고 CPU·GPU 같은 계산 장치에서 실제로 실행하는 엔진입니다.
모델 파일은 악보, CPU·GPU는 연주자, 런타임은 악보를 읽고 연주를 조율하는 지휘자라고 생각하면 쉽습니다.
ONNX Runtime — 이미지·음성·언어 등 다양한 모델을 여러 운영체제와 하드웨어에서 실행하는 범용 엔진입니다. 실행 공급자(Execution Provider)를 통해 장치별 가속기를 연결합니다.
llama.cpp — 로컬과 클라우드의 다양한 장치에서 LLM·VLM을 간단히 실행하는 데 초점을 둔 엔진입니다. GGUF 형식의 모델 파일과 흔히 함께 쓰입니다.
FreeToken — 아주 큰 MoE 모델을 개인용 하드웨어에서 실행하도록 특화된 신형 엣지 런타임입니다. NVIDIA GPU·CPU·호스트 RAM과 그 사이 연결을 하나의 추론 플랫폼처럼 조율합니다.
파라미터란?
- 텐서
- 행렬
- 벡터
- 스칼라 = 파라미터 1개
- 벡터
- 행렬
[0.2, −0.7, 1.3] 벡터 1개 · 스칼라 숫자 3개 · 파라미터 3개8B의 B는 Byte가 아니라 Billion(10억)입니다. 8B 모델은 벡터 80억 개가 아니라 스칼라 파라미터가 약 80억 개라는 뜻입니다.
파라미터와 가중치
- 가중치
- 편향
- 임베딩
- 정규화 계수
y = w₁x₁ + w₂x₂ + b가중치는 파라미터이지만, 모든 파라미터가 가중치인 것은 아닙니다.
자세히 보기
파라미터는 모델이 학습하며 얻거나 조정한 스칼라 숫자 하나입니다. 벡터·행렬·텐서는 숫자를 담는 그릇이고, 그 안의 스칼라 숫자 하나하나를 파라미터로 셉니다.
가중치는 파라미터의 대표적인 종류로, 입력을 얼마나 강하게 반영할지 정합니다. 편향·임베딩·정규화 계수 등도 파라미터가 될 수 있습니다.
파라미터 하나가 지식 하나를 담은 상자는 아닙니다. 텐서·행렬이 서랍장이라면 파라미터는 그 안의 숫자 한 칸이고, 비트 수는 그 숫자를 얼마나 정밀하게 기록할지를 뜻합니다.
파라미터 하나는 몇 비트일까?
자세히 보기
파라미터는 숫자 하나지만 서로 다른 정밀도로 저장할 수 있습니다. 비트 수를 줄이면 보통 메모리가 절약되지만, 실제 양자화 파일에는 스케일·메타데이터 같은 추가 용량도 생깁니다.
왜 8B 모델이 약 8GB일까?
가중치 용량 ≈ 파라미터 수 × 파라미터당 비트 수 ÷ 8표의 값은 순수 가중치를 십진 단위로 단순 계산한 이론값입니다. 실제 양자화 파일은 스케일·메타데이터·그 밖의 구조 때문에 더 클 수 있습니다.
자세히 보기
8비트 정밀도에서는 파라미터 하나가 약 1바이트입니다. 따라서 80억 파라미터의 순수 가중치는 약 8GB입니다. 파라미터 수가 같아도 정밀도가 바뀌면 용량도 달라집니다.
실제 실행에는 메모리가 더 필요하다
- 가중치
- KV 캐시
- 계산 버퍼
- 런타임 오버헤드
KV 캐시는 문맥이 길수록 커져요
실행 메모리 = 가중치 + KV 캐시 + 계산 버퍼 + 런타임 오버헤드자세히 보기
가중치 파일은 시작일 뿐입니다. 추론할 때는 이전 토큰을 기억하는 KV 캐시, 임시 계산 버퍼, 런타임 오버헤드도 필요합니다. 이론상 4GB인 모델도 실제로는 5~8GB 이상을 쓸 수 있고, 문맥이 길수록 보통 KV 캐시가 커집니다.
작은 숫자가 어떻게 많은 지식을 표현할까?
자세히 보기
8비트는 256단계를 표현하지만, 파라미터 하나에 ‘서울은 대한민국의 수도’ 같은 문장이 들어 있지는 않습니다. 지식은 여러 층에서 상호작용하는 수십억 개 파라미터의 패턴 전체에 분산됩니다.
픽셀 하나는 단순한 색상값이지만 수백만 개가 배열되면 얼굴과 풍경이 나타납니다. 모델의 지식도 이와 비슷하게 분산된 숫자 패턴에서 드러납니다.
AI 모델은 벡터·행렬·텐서로 묶인 방대한 스칼라 파라미터의 패턴입니다. 정밀도가 이론상 가중치 용량을 정하고, 런타임은 가중치를 메모리에 올린 뒤 추가 작업 메모리를 사용해 하드웨어에서 실행합니다.
같은 길을, 한 칸씩 전부
- 1 내 손에서 프로그램까지
- 2 보낼 것을 싼다
- 3 인터넷을 건넌다
- 4 서버 문 앞
- 5 서버 안 — 기계와 런타임
- 6 모델이 계산한다
- 7 토큰 하나씩, 몇 번이고
- 8 돌아오는 길
- 9 프로그램이 받는다
- 10 손을 빌리는 반복
1 내 손에서 프로그램까지 1번 구역 4단계
-
키가 눌린다
키보드 안의 작은 컴퓨터가 어느 키가 움직였는지 알아채고, 그것을 숫자로 만들어 선으로 흘려보냅니다.
-
운영체제가 받는다
커널의 드라이버가 그 숫자를 입력 사건으로 바꾸고, 지금 맨 앞에 있는 창을 향해 줄을 세웁니다.
-
프로그램이 줄에서 꺼낸다
모든 프로그램은 사건을 하나씩 꺼내 처리하는 반복문을 돌고 있습니다. 입력칸에 글자가 찍히는 것이 이 단계입니다.
-
마이크는 다른 길로 간다
음성 인식으로 글자를 만든 뒤 텍스트 모델에 보낼 수 있어요. 음성을 직접 받는 모델도 있어요. 마이크 권한과 선택한 서비스에 따라 처리 위치가 달라져요.
2 보낼 것을 싼다 1번 구역 7단계
-
시스템 프롬프트
프로그램을 만든 사람이 미리 써 둔 규칙이 맨 앞에 붙습니다 — 너는 무엇이고 어떻게 답해야 하는지.
-
지금까지의 대화
앱이 문맥 한도 안에서 메시지·지시·허용된 첨부를 선택해요. 이전 내용을 자르거나 요약하거나 검색할 수 있어요. 빠진 내용을 자동으로 기억하지 않으며 요약도 정보를 잃을 수 있어요.
-
내가 붙인 것
이미지는 바이트·파일 ID·URL·base64 등 API가 지원하는 방식으로 보내요. PDF는 글자·페이지 이미지·OCR 결과로 처리할 수 있어요. 지원 형식·추출 품질·크기 한도는 서비스마다 달라요.
-
내 자료 뒤지기(RAG)
RAG는 자료를 검색해 생성할 때의 문맥으로 넣어요. BM25 같은 키워드 검색, 임베딩 검색 또는 둘 다 쓸 수 있어요. 보통 가중치를 재학습하지 않으며 자료의 출처·관련성도 확인해야 해요.
-
도구 목록
도구는 앱 API나 MCP로 연결할 수 있어요. MCP는 로컬·원격 서버의 도구·리소스·프롬프트를 제공할 수 있어요. 사용 가능 여부는 모델 자체가 아니라 앱 설정과 권한으로 정해져요.
-
스킬과 커맨드
스킬은 지시와 선택적 스크립트·참고 파일을 묶어요. 호환 에이전트가 필요할 때 관련 부분을 읽어요. Agent Skills 사이트는 형식 명세이며 스킬의 안전성·정확성을 보증하지 않아요.
-
한도에 맞추기
앱이 문맥 한도 안에서 메시지·지시·허용된 첨부를 선택해요. 이전 내용을 자르거나 요약하거나 검색할 수 있어요. 빠진 내용을 자동으로 기억하지 않으며 요약도 정보를 잃을 수 있어요.
3 인터넷을 건넌다 2번 구역 4단계
-
주소 찾기
서버의 이름을 숫자로 된 주소로 바꿉니다(DNS).
-
길을 열고 자물쇠를 채운다
HTTPS는 연결을 암호화해요. HTTP/1.1·2는 보통 TCP와 TLS를, HTTP/3는 QUIC을 써요. 실시간 서비스는 WebSocket·WebRTC도 써요. 그림은 연결의 역할을 보여주며 한 방식만 강제하지 않아요.
-
누구인지 밝히기
요청 머리에 열쇠(API 키)나 표(토큰)를 붙입니다. 누구 몫으로 계산할지가 여기서 정해집니다.
-
요청 보내기
HTTPS는 연결을 암호화해요. HTTP/1.1·2는 보통 TCP와 TLS를, HTTP/3는 QUIC을 써요. 실시간 서비스는 WebSocket·WebRTC도 써요. 그림은 연결의 역할을 보여주며 한 방식만 강제하지 않아요.
4 서버 문 앞 3번 구역 3단계
-
문지기
열쇠가 맞는지, 너무 자주 부르지는 않는지 보고, 한가한 계산 기계에게 넘깁니다.
-
대기줄
문 앞에서는 열쇠를 확인하고 잠깐 줄을 세웁니다. 그리고 나중에 계산할 때, 런타임이 이미 올려 둔 그 한 벌의 숫자로 기다리던 여러 질문을 함께 계산합니다.
-
들어온 것 살피기
계산을 시작하기 전에 규칙에 어긋나는 요청은 아닌지 먼저 봅니다.
5 서버 안 — 기계와 런타임 3번 구역 3단계
-
숫자 파일이 잠들어 있다
학습이 끝난 모델은 저장 장치에 놓인 커다란 파일입니다. 그 자체로는 아무 계산도 하지 않습니다. 이 사이트의 음성 모델도 파일 네 개, 다 합쳐 약 398MB 입니다.
-
런타임이 한 번 올린다
런타임이 모델 파일을 읽고 추론해요. 준비된 워커는 보통 가중치를 재사용하지만 콜드 스타트·퇴거·오프로딩·재시작 때 다시 읽을 수 있어요. 모델을 여러 장치나 서버에 나누기도 해요.
-
가속기가 곱셈을 맡는다
같은 곱셈을 엄청나게 많이 해야 해서, 바로 그 일을 위해 만든 부품에 맡깁니다. 그 옆의 빠른 기억에 숫자들이 머뭅니다. 보통 CPU 로도 할 수 있고, 그때는 느릴 뿐입니다.
런타임은 가속기 안에 들어 있는 것이 아닙니다. 파일을 읽어 그 부품 옆의 기억으로 숫자를 올려 두는, 따로 도는 프로그램입니다.
여러 요청을 묶는 일은 17번, 해 둔 계산을 아껴 두는 일은 27번 — 둘 다 이 프로그램이 합니다.
6 모델이 계산한다 4번 구역 7단계
-
토큰으로 자르기
토크나이저는 글 조각을 자기 어휘의 ID로 바꿔요. 조각은 단어·부분어·글자·바이트일 수 있어요. 같은 글도 토크나이저마다 ID와 토큰 수가 달라질 수 있어요.
-
번호를 숫자 목록으로
토큰 ID로 학습된 임베딩 벡터를 찾아요. ID 숫자의 크기는 의미를 나타내지 않아요. 벡터의 유사성은 모델·과제에 따라 유용할 수 있지만 가깝다고 뜻이 항상 같지는 않아요.
-
순서 표시하기
위치 정보로 토큰 순서를 구별해요. 위치 벡터를 더하는 구조도 있고 회전 위치 임베딩 같은 방식도 있어요. 모든 Transformer가 같은 방식은 아니에요.
-
서로 쳐다보기(어텐션)
자기회귀 Transformer는 여러 층에서 attention과 다른 변환을 수행해요. 인과적 attention은 허용된 앞 위치만 보며 범위가 제한되기도 해요. 구조와 층 수는 모델마다 달라요.
-
층층이 곱하고 더하기
자기회귀 Transformer는 여러 층에서 attention과 다른 변환을 수행해요. 인과적 attention은 허용된 앞 위치만 보며 범위가 제한되기도 해요. 구조와 층 수는 모델마다 달라요.
-
전부에 점수 매기기
마지막 층이 아는 토큰 전부에 점수를 냅니다. 수만 개에 한꺼번에 점수가 붙습니다.
-
하나 고르기
softmax가 logits를 확률로 바꿔요. 온도는 샘플링 전 logits를 조정해요. top-k는 후보 수, top-p는 누적 확률로 후보를 제한해요. 탐욕 선택은 최고 점수를 골라요. 온도 0 처리는 제공자마다 달라요.
7 토큰 하나씩, 몇 번이고 4번 구역 3단계
-
뒤에 이어 붙이기
-
해 둔 계산 아껴 쓰기
KV 캐시는 자기회귀 생성에서 이전 attention의 키·값을 재사용해요. 재계산을 줄이지만 메모리가 필요해요. 지연은 문맥 길이·배치·장치·네트워크에도 달려 있어 뒤 토큰이 항상 빠르지는 않아요.
-
22번으로 되돌아감
모델이 구조화된 도구 호출을 제안하면 앱이 검증하고 권한 안에서 로컬이나 원격 서비스에서 실행해요. 결과를 모델에 다시 보낼 수 있어요. 횟수 제한·취소·실패로 반복이 멈출 수도 있어요.
답을 써 내려가는 반복이 이것입니다 — 토큰 하나마다 22번으로 되돌아갑니다.
8 돌아오는 길 2번 구역 4단계
-
토큰 번호를 읽을 수 있는 글자로 되돌리기
-
나오는 대로 흘려보내기
답 전체를 기다리지 않고, 만들어지는 대로 작은 덩어리로 밀어 보냅니다(SSE).
-
나가는 것 살피기
나가는 글도 규칙에 어긋나지 않는지 봅니다.
-
쓴 만큼 적어 두기
보낸 토큰과 받은 토큰의 수를 셉니다. 요금이 나오는 곳이 여기입니다.
9 프로그램이 받는다 5번 구역 4단계
-
도착한 조각을 순서대로 잇기
-
화면에 그리기
마크다운을 읽어 제목·목록·코드 상자로 바꿔 그립니다. 타자를 치는 것처럼 보이는 부분이 이것입니다.
-
도구 요청 찾아내기
답 안에 정해진 형식의 도구 호출이 섞여 있는지 프로그램이 지켜봅니다.
-
인자 확인하기
그런 도구가 실제로 있는지, 인자 모양이 맞는지를 실행 전에 검사합니다.
10 손을 빌리는 반복 5번 구역 4단계
-
허락 묻기
권한·격리·검증·필요한 승인은 앱이나 서비스가 강제해야 해요. 시스템 프롬프트만으로 보안 경계가 되지는 않아요. 미리 허용한 작업은 다시 묻지 않을 수 있고 구현이 잘못되면 통제가 실패할 수 있어요.
-
실제로 하기
모델이 구조화된 도구 호출을 제안하면 앱이 검증하고 권한 안에서 로컬이나 원격 서비스에서 실행해요. 결과를 모델에 다시 보낼 수 있어요. 횟수 제한·취소·실패로 반복이 멈출 수도 있어요.
-
결과 담기
무엇이 나왔는지, 실패했다면 왜인지를 6번의 대화에 새 줄로 담습니다.
-
15번으로 되돌아감
모델이 구조화된 도구 호출을 제안하면 앱이 검증하고 권한 안에서 로컬이나 원격 서비스에서 실행해요. 결과를 모델에 다시 보낼 수 있어요. 횟수 제한·취소·실패로 반복이 멈출 수도 있어요.
사람들이 에이전트라고 부르는 반복이 이것입니다 — 15번으로 몇 번이고 되돌아갑니다.