긴 대화는 왜 점점 산만해질까
1. 같은 모델인데 시간이 지나면 왜 답이 흐트러질까
ChatGPT나 Claude를 길게 쓰다 보면 누구나 한 번쯤 경험하는 장면이 있습니다. 처음엔 척척 잘 알아듣던 AI가 어느 순간부터 앞서 약속한 것을 잊고, 똑같은 실수를 반복하고, 엉뚱한 방향으로 빠집니다. "방금까지는 잘 하더니 왜 갑자기..."를 속으로 중얼거리게 되지요.
이건 사용자 잘못이 아니라 LLM의 구조적 특성입니다. 그리고 이 특성을 한 번 이해해두면 채팅창에서의 작업 습관이 통째로 바뀝니다. 같은 도구를 두고 결과 차이가 가장 크게 벌어지는 지점도 사실 4요소 프롬프트보다 여기에 있다고 봐도 됩니다.
2. 컨텍스트 윈도우, 모델이 한 번에 보는 책상
LLM은 한 번에 처리할 수 있는 토큰 수가 정해져 있습니다. 이 한계를 컨텍스트 윈도우(Context Window) 라고 부릅니다. 사람으로 치면 "한 번에 머릿속에 담아두고 같이 생각할 수 있는 분량"입니다.
| 모델 | 컨텍스트 윈도우 | 최대 출력 |
|---|---|---|
| Claude Opus 5 | 1,000,000 토큰 (1M) | 128K 토큰 |
| Claude Sonnet 5 | 1,000,000 토큰 (1M) | 128K 토큰 |
| Claude Haiku 4.5 | 200,000 토큰 (200K) | 64K 토큰 |
| GPT-4o (구버전 참고용) | 128,000 토큰 (128K) | 16K 토큰 |
(2026년 8월 기준. 모델 사양은 자주 바뀌니, 정확한 숫자는 각 회사의 모델 문서를 확인하세요.)
1M 토큰이면 영어 기준 약 75만 단어, 장편 소설 10권 분량입니다. ChatGPT 초기(8K~32K)와 비교하면 100배쯤 커졌습니다. 그러니 컨텍스트 윈도우가 모자라서 문제가 생기는 일은 일상적인 채팅 사용에선 거의 없다고 봐도 됩니다.
문제는 다른 자리에 있습니다. 윈도우가 크다고 그 안에 있는 정보를 모델이 잘 활용하는 것은 아닙니다. 다음 두 연구가 같은 사실을 가리킵니다.
3. Lost in the Middle, 중간에 묻힌 정보는 잘 안 본다
2023년 7월, Stanford와 UC Berkeley 등의 연구자들이 발표한 Lost in the Middle: How Language Models Use Long Contexts 논문은 흥미로운 결과를 보고했습니다. 같은 정보를 컨텍스트의 어느 위치에 놓느냐에 따라 모델이 그걸 찾아내는 정확도가 크게 달라진다는 것이었습니다.
그래프로 그리면 U자 곡선이 나옵니다. 컨텍스트의 시작과 끝에 있는 정보는 잘 활용되는데, 중간에 묻힌 정보는 모델이 못 보고 지나가는 경우가 많습니다. 사람으로 치면, 두꺼운 보고서를 받았을 때 첫 페이지와 마지막 페이지는 자세히 보지만 중간 50쪽은 대충 넘기는 것과 비슷합니다.
비슷한 결과가 NoLiMa 벤치마크에서도 나옵니다. 컨텍스트가 길어질수록 모델이 표면 단어 매칭이 아닌 "의미상 연결되는 정보"를 찾는 능력이 급격히 떨어진다고 보고합니다. GPT-4o조차 컨텍스트 32K 토큰에서는 정확도가 99%에서 70%로 떨어집니다.

여기서 바로 따라 나오는 실용 지침이 있습니다.
- 가장 중요한 정보는 앞 또는 끝에 둡니다. 중간에 묻으면 모델이 잘 안 봅니다.
- 핵심 지시문은 프롬프트 맨 끝에 한 번 더 적어 줍니다. 길어진 대화에서 효과가 큽니다.
- 참조 문서를 길게 붙일 때는 그 안에서도 핵심을 앞이나 뒤로 빼둡니다.
4. 멀티턴 대화에서 정확도가 25점 떨어진다
2025년에 발표된 LLMs Get Lost In Multi-Turn Conversation 연구는 더 충격적인 숫자를 보여줍니다. 같은 작업을 한 번에 정확하게 지시했을 때와, 여러 턴에 걸쳐 조금씩 정보를 주면서 진행할 때를 비교했더니, 평균 정확도가 90%에서 65%로 25%포인트 떨어졌습니다. 최신 모델들도 예외가 아니었습니다.
이유는 두 가지로 분석됩니다.
- 앞쪽 대화의 가정에 묶입니다. 첫 답에서 한 번 잘못된 방향을 잡으면, 그 뒤로 새 정보가 들어와도 그 가정을 잘 못 뒤집습니다.
- 흩어진 정보를 모아 추론하지 못합니다. 같은 사실이 여러 턴에 나눠 들어가면, 그걸 다시 묶어서 결론을 내는 능력이 떨어집니다.
이 결과는 우리가 평소에 ChatGPT를 쓰는 방식과 정면으로 부딪힙니다. 사람들은 보통 "일단 시켜보고, 결과 보고 한 줄씩 고치는" 식으로 진행하는데, 이 방식이 모델 입장에서는 가장 안 좋은 시나리오입니다.
5. 그래서 어떻게 써야 하나
위 두 가지 사실에서 곧바로 따라 나오는 실용 패턴 네 가지입니다. 평소 습관에 박아두면 결과가 눈에 띄게 좋아집니다.
5.1 한 번에 정리해서 던지기
머리 속에서 정리가 어느 정도 됐을 때 한 번에 깔끔하게 던집니다. 작업 도중에 빠뜨린 정보가 떠올라도, 즉시 추가 메시지로 던지지 말고 첫 메시지를 수정해서 다시 보내는 편이 낫습니다(대부분의 채팅 도구는 메시지 수정 기능이 있습니다).
5.2 작업이 끝나면 새 대화로 끊기
대화가 길어질수록 산만해지니까, 한 작업이 끝났으면 미련 없이 새 창을 엽니다. ChatGPT, Claude 같은 채팅 도구는 보통 Cmd+Shift+O나 New Chat 버튼이 있고, Claude Code 같은 CLI 도구는 /clear로 컨텍스트를 비웁니다. "어차피 긴데 이어서 하자"가 가장 자주 하는 실수입니다.
5.3 새 창에 시작 패키지 미리 준비해두기
새 대화를 자주 시작하다 보면, 매번 같은 배경 정보를 다시 적어야 하는 게 귀찮아집니다. 그래서 "이 작업을 위한 시작 패키지"를 따로 메모해 두고, 새 대화를 열 때마다 그걸 첫 메시지로 붙여 넣는 습관이 효율적입니다. 다음 4장 컨텍스트 엔지니어링과 5장 하네스 엔지니어링이 이 "시작 패키지를 자동으로 깔아주는" 자동화 이야기입니다.
5.4 같은 질문을 여러 창에 던지기
LLM은 확률 기반이라 같은 입력에 매번 살짝 다른 답을 줍니다. 카피라이팅처럼 "최선의 한 안"을 찾아야 할 때는 새 창 두세 개를 열어 같은 프롬프트를 던지고 가장 좋은 답을 고르는 방식이 단순하지만 강력합니다.
6. 정리하면
같은 모델이 누구한테는 잘 하고 누구한테는 평범한 답을 주는 이유가, 4요소를 빠뜨려서일 수도 있지만 컨텍스트를 깨끗하게 끊지 못해서일 가능성이 훨씬 큽니다. 그리고 이 문제는 모델이 더 좋아진다고 자연스럽게 해결되지 않습니다. 위의 두 연구 모두 최신 모델에서도 동일한 패턴을 발견했습니다.
여기서 다룬 내용은 자연스럽게 4장 컨텍스트 엔지니어링으로 넘어갑니다. "이번 작업에 모델이 봐야 할 정보를, 어느 위치에, 어떻게 정리해서 깔아둘 것인가." 컨텍스트 엔지니어링의 본질이 결국 여기 있습니다. 이어서 한 꼭지를 더 빌려, 그 전에 짚어둬야 할 마지막 약점인 할루시네이션을 다룹니다.