본문 바로가기

환각의 비밀

생성형 AI를 처음 쓰는 분들이 가장 많이 하는 오해가 "더 똑똑한 검색엔진"이라는 생각입니다. 채팅창에 질문을 입력하면 답이 나오니 검색과 비슷해 보이지만, 안에서 벌어지는 일은 정반대에 가깝습니다. 이 차이를 먼저 잡아야 이번 절의 주인공인 그럴듯한 거짓말을 이해할 수 있습니다.

1. 검색과는 다른 도구

검색 엔진은 도서관 사서와 비슷합니다. 여러분이 질문하면 서가에서 이미 존재하는 책을 찾아다 줍니다. 사서는 책 내용을 지어내지 않습니다. 반면 생성형 AI는 작가에 가깝습니다. 질문을 받으면 그동안 읽은 것들을 바탕으로 그 자리에서 새 글을 써냅니다. 앞 절들에서 봤듯, 다음 단어를 확률로 뽑아 이어 붙이는 방식입니다. 어딘가에 있던 문서를 복사해 오는 것이 아닙니다.

검색 엔진생성형 AI
하는 일있는 것을 찾아온다없던 것을 만들어낸다
결과물다른 사람이 쓴 문서의 링크방금 새로 만들어진 글
출처명확하다기본적으로 없다
같은 질문을 두 번 하면같은 결과다른 답이 나올 수 있다

이 차이에서 생성형 AI의 강점과 약점이 동시에 나옵니다.

  • 강점: 세상 어디에도 없던 답을 받을 수 있습니다. "우리 회사 상황에 맞춘 인사말"이나 "내 일정에 맞춘 여행 계획"은 검색으로는 찾을 수 없습니다. 애초에 존재하지 않는 문서이기 때문입니다.
  • 약점: 새로 지어내는 것이기 때문에, 사실이 아닌 내용을 사실처럼 그럴듯하게 써낼 수 있습니다. 출처도 기본적으로는 없습니다.

이 약점이 실제로 어떤 사고를 치는지 보겠습니다.

2. 세종대왕 맥북 던짐 사건

ChatGPT가 막 유명해지던 시절, "조선왕조실록에 기록된 세종대왕 맥북 던짐 사건에 대해 알려줘"라는 질문이 화제가 된 적이 있습니다. 당시 AI는 "그런 사건은 없습니다"라고 답하는 대신, 세종대왕이 훈민정음 초고 작성 중 분노하여 맥북을 던졌다는 그럴듯한 역사 해설을 지어냈습니다.

이렇게 사실이 아닌 내용을 사실처럼 만들어내는 현상을 환각(hallucination, 할루시네이션)이라고 부릅니다. 왜 이런 일이 생기는지 직접 재현해 보겠습니다.

3. 같은 기계, 두 개의 질문

시뮬레이터의 '환각의 비밀' 페이지는 진짜 있는 것을 묻는 질문과 세상에 없는 것을 묻는 질문을 같은 확률 기계에 동시에 넣습니다.

접속하면 왼쪽에 "세종대왕이 만든 문자는 무엇인가요?", 오른쪽에 "세종대왕이 만든 스마트폰 이름은 무엇인가요?"라는 질문이 나란히 보입니다. 자동 재생을 누르고 두 가지를 지켜봐 주세요. 양쪽 확률 막대가 똑같이 당당하게 움직인다는 것, 그리고 노란색으로 표시되는 "그런 건 없어요" 후보의 막대가 늘 바닥에 깔려 있다는 것입니다.

두 질문의 생성이 끝난 화면

왼쪽은 "한글입니다"라는 정답을, 오른쪽은 "조선갤럭시입니다"라는 그럴듯한 거짓을 만들었습니다. 기계 입장에서 두 작업은 아무 차이가 없었습니다.

생성이 끝나면 화면에 평결이 나옵니다.

시뮬레이션의 평결

두 답의 평균 확신도는 왼쪽 73%, 오른쪽 57%로 비슷했습니다. 당당한 말투와 사실 여부는 별개라는 것, 그리고 "그런 건 없어요"가 뽑힐 확률은 처음부터 6%뿐이었다는 것이 핵심입니다.

이제 설명할 수 있습니다. 모델은 진실과 거짓이라는 개념 자체가 없습니다. 하는 일은 오직 하나, 그럴듯한 다음 단어 고르기입니다. "세종대왕이 만든 스마트폰 이름은"이라는 문장 뒤에는 그럴듯한 제품명 같은 단어들이 올 확률이 높게 계산됩니다. 훈련 데이터 속 문장들은 대부분 질문에 답을 하는 글이라서, "모르겠어요"가 뽑힐 확률은 늘 작습니다. 모델 입장에서는 평소와 똑같이, 아주 성실하게 일한 결과입니다.

4. 그래서 어디까지 믿어야 하나

환각은 고장이 아닙니다. 확률로 글을 만드는 방식에서 자연스럽게 따라오는 부작용입니다. 최신 모델일수록 빈도가 줄고는 있지만, 원리가 같은 이상 완전히 사라지지는 않습니다. 그러니 도구를 쓰는 우리가 기준을 갖고 있어야 합니다.

  • 믿고 맡겨도 되는 일: 초안 쓰기, 아이디어 내기, 문장 다듬기, 요약처럼 정답이 없거나 내가 결과를 보고 판단할 수 있는 일
  • 반드시 검증해야 하는 일: 날짜, 숫자, 인용, 법령, 의학 정보처럼 사실 여부가 중요한 일. 출처를 직접 확인하기 전까지는 가설로만 취급합니다.

참고로 환각을 줄이는 가장 확실한 방법은 근거 자료를 함께 주는 것입니다. "이 문서를 바탕으로 답해줘"라고 자료를 건네면, 모델은 지어내는 대신 주어진 자료에서 그럴듯한 다음 단어를 고르게 됩니다. 자료가 답의 확률을 어떻게 바꾸는지는 '프롬프트의 비밀' 절에서 눈으로 확인합니다.

다음 절에서는 환각과 한 뿌리에서 나오는 현상을 하나 더 봅니다. 컴퓨터가 계산을 틀리는 이상한 장면입니다.

환각의 비밀 - 딱 필요한 만큼: 생성형 AI 기초 | 위니버시티