이미지·음성의 비밀
요즘 AI에는 사진을 올리면 설명해 주고, 말로 물으면 알아듣고, 그림을 그려 달라면 그려 줍니다. 그래서 언어 모델이 눈과 귀와 손을 얻었다고 생각하기 쉽습니다. 그런데 앞 절까지 본 언어 모델은 글자 토큰이 들어가서 글자 토큰이 나오는 함수였습니다. 이 함수가 사진과 소리를 어떻게 다루는 걸까요. 답부터 말하면, 언어 모델은 여전히 글자만 읽습니다. 사진과 소리는 전용 모델이 먼저 숫자로 바꿔서 건네주고, 그 과정에서 정보가 흐려집니다. 시뮬레이터의 '이미지·음성의 비밀' 페이지를 열어 주세요.
화면에는 패널 세 개가 내가 보낸 것, 전용 모델, 언어 모델 (LLM) 순서로 놓여 있습니다. 파일을 올리거나 자르는 실습은 없고, 자동 재생이나 한 단계씩 버튼을 눌러 눈으로 따라가면 됩니다. 단계마다 관련 패널 위에 설명 말풍선이 뜹니다. 데모는 네 개인데, 데모 고르기 목록에서 바꿀 수 있습니다.
1. 사진은 조각으로 읽는다
첫 번째 데모 '사진을 보내면'이 기본으로 선택되어 있습니다. 집 사진과 함께 "이 사진 설명해 줘"라고 묻는 상황입니다.
한 단계씩을 두 번 눌러 2단계까지 가 보세요. 오른쪽 언어 모델 패널을 보면 질문은 토큰 5개로 잘려 들어갔는데, 사진 파일은읽을 수 없음으로 문 앞에서 막혀 있습니다.- 한 번 더 눌러 3단계로 가면 가운데 패널에 눈 역할을 하는 전용 모델(시각 인코더)이 등장해 사진을 8×8 격자, 그러니까 조각 64개로 자릅니다. 토큰의 비밀에서 글을 토큰으로 잘랐던 것과 같은 일을 사진에 하는 셈입니다.
- 4단계에서 조각 하나하나가 숫자 묶음으로 바뀝니다.

조각 하나가 숫자 묶음 하나가 됩니다. 조각 안의 색이 평균으로 뭉개지기 때문에, 조각보다 작은 것은 사라집니다. 원본에 있던 OPEN 표지판 글씨가 모자이크에서는 읽히지 않습니다.
- 5단계와 6단계까지 눌러 보세요.

숫자 묶음 64개가 질문 토큰 5개 앞에 줄지어 붙고, 언어 모델은 이것을 한 줄로 읽습니다. 사진을 "본" 것이 아니라 번역된 숫자를 "읽은" 것입니다. 그리고 답은 언제나 글로 나옵니다.
이 화면은 원리를 보여 주는 모형입니다. 실제 모델은 사진을 28~32픽셀짜리 아주 작은 조각 수천 개로 나누고, 조각마다 수백 개의 숫자를 만듭니다. Claude 공식 문서 기준으로 1000×1000 사진 한 장이 토큰 약 1,300개입니다. 조각이 작으니 또렷한 글씨는 잘 읽습니다. 그래도 조각보다 작거나 흐린 것이 평균에 묻히는 원리는 같아서, 공식 문서들도 작거나 흐린 글씨, 축소된 캡처, 물건 개수 세기, 정확한 위치를 약점으로 꼽습니다.
2. 소리는 받아쓰기로 읽는다
데모 고르기에서 두 번째 '목소리를 보내면'을 고르세요. 친구가 실수한 뒤 한숨 섞인 말투로 "정말~ 잘했네"라고 말한 상황입니다. 말투를 들으면 칭찬이 아니라 비꼬는 말입니다.
- 2단계까지 가면 사진 때와 똑같이 음성 파일이
읽을 수 없음으로 막힙니다. 파형은 숫자의 물결일 뿐 글자 토큰이 아니기 때문입니다. - 3단계에서 귀 역할을 하는 전용 모델(음성 인식)이 소리를 0.4초씩 시간 순서대로 자릅니다. 사진이 공간을 나눴다면 소리는 시간을 나눕니다.
- 4단계에서 조각을 글자로 받아씁니다. 받아쓰기 종이 아래
사라진 것목록을 보세요. - 6단계까지 눌러 답을 확인하세요.

받아쓰기 종이에는 "정말 잘했네"만 남습니다. 길게 끄는 "말~", 끝을 올리는 억양, 한숨과 비꼬는 말투는 글자에 담기지 않습니다. 언어 모델에게는 토큰 3개만 도착하니, 칭찬으로 알아듣고 고맙다고 답합니다.
음성 기능에는 두 갈래가 있습니다. 하나는 이 데모처럼 받아쓰기를 거치는 길이고, 다른 하나는 소리의 숫자 묶음을 글자로 바꾸지 않고 직접 읽도록 학습한 모델을 쓰는 길입니다. 뒤쪽 모델은 말투나 배경 소리를 어느 정도 알아챕니다. 같은 서비스라도 고른 모델과 모드에 따라 어느 길인지 달라서, "음성 지원"이라는 말만 보고 말투까지 전달된다고 기대하면 안 됩니다.
3. 사진 수정은 다시 그리기다
세 번째 데모 '사진을 고쳐 달라고 하면'을 고르세요. 아까 그 집 사진을 주며 "지붕만 보라색으로 바꿔 줘"라고 부탁합니다. 포토샵이라면 지붕만 칠하면 끝나는 일입니다.
- 2단계에서 가운데 패널을 보세요. 언어 모델은 눈 모델을 거쳐 사진을 숫자로 읽기는 하지만, 낼 수 있는 것은 글자 토큰뿐이라 그림 위에 색칠할 수 없습니다.
- 3단계에서 언어 모델이 할 수 있는 유일한 일을 합니다. 손 역할을 하는 모델에게 보낼 주문서를 쓰는 것입니다. 주문서는 "보라색 지붕, 파란 문, 창문 2개, OPEN 표지판이 있는 집 그림"이라는 글이라서, 원본의 정확한 모양은 여기서 손을 떠납니다.
- 4단계에서 이미지 생성 모델이 주문서를 읽고 처음부터 새로 그립니다.
- 5단계에서 원본과 비교합니다.

지붕은 보라색이 됐지만 문 색이 파란색에서 청록색으로, 창문이 2개에서 3개로, 표지판 글자가 OPEN에서 OPFN으로, 해의 위치까지 달라졌습니다. 원본을 고친 것이 아니라 비슷한 그림을 다시 만들었기 때문입니다. 글은 단어 하나만 바꿀 수 있지만, 이미지는 다시 그리기라서 세밀한 수정이 어렵습니다. 한 번 더 고쳐 달라고 하면 또 새로 그립니다.
여기서 사진을 읽는 능력과 만드는 능력이 별개라는 점도 드러납니다. Claude는 공식 문서에서 이미지를 만들거나 편집하지 않는다고 밝히고, ChatGPT는 별도의 이미지 모델을 붙여 씁니다. 요즘은 원본을 옆에 두고 그리는 편집 기능이 있어 예전보다 훨씬 나아졌지만, 그래도 "그리기"라서 글자, 손가락, 세부가 흔들립니다. 정확히 그 부분만 바꿔야 하면 편집 도구가 확실합니다.
4. 같은 정보라면 글로
네 번째 데모 '같은 정보, 사진 vs 글'을 고르세요. 같은 매출 표를 캡처한 사진과 글로 적은 표, 두 가지로 준비했습니다.
- 2단계에서 사진의 길을 봅니다. 눈 모델이 조각 64개로 자르면서 작은 숫자가 뭉개집니다.
- 3단계에서 글의 길을 봅니다. 글은 바로 토큰 9개가 되고, 잃어버리는 정보가 없습니다.
- 4단계에서 두 답을 비교합니다.

사진으로 받은 쪽은 3월 매출 1,280만 원을 1,260만 원으로 잘못 읽었고, 글로 받은 쪽은 정확하게 읽고 계산까지 맞습니다. 비용도 다릅니다. 실제 서비스에서 1000×1000 사진 한 장은 토큰 약 1,300개인데, 이 표를 글로 쓰면 수십 개입니다. 같은 정보를 사진으로 주면 수십 배 느리고 비싼 셈입니다.
5. 그래서 어떻게 할까
페이지 아래 '그래서 어떻게 할까요?'에 데모에서 본 것을 실제 사용에 적용하는 정리가 두 카드로 있습니다.

먼저 플랫폼과 모델을 고를 때입니다. "멀티모달 지원"이라고 적혀 있어도 무엇을 어디까지 하는지는 제각각이라 네 가지를 따로 확인해야 합니다.
- 사진을 읽을 수 있나: 이미지 입력을 지원하는 모델인지 봅니다.
- 목소리를 직접 듣나, 받아쓰기만 하나: 받아쓰기라면 말투와 억양은 전달되지 않습니다.
- 그림을 만들 수 있나: 언어 모델의 능력인지, 옆에 붙은 별도 도구인지 구분합니다.
- 목소리로 답하나: 음성 입력과 음성 출력은 따로 확인합니다.
다음은 AI에게 정보를 줄 때입니다.
- 글이 있으면 글로: 표, 문서, 코드는 캡처하지 말고 복사해서 붙여 넣습니다.
- 글씨가 든 캡처는 되도록 피하기: 또렷하면 읽기는 하지만 작거나 흐린 글씨는 틀리기 쉽고, 사진 한 장이 글 수십 배의 토큰을 씁니다.
- 사진이어야 하는 것만 사진으로: 그림, 도면, 현장 사진처럼 말로 옮기기 어려운 것만 사진으로 줍니다.
- 음성은 받아쓴 글을 확인: 억양과 강조는 사라지니 중요한 뜻은 글로 덧붙입니다.
- 사진 수정은 편집 도구로: AI 생성은 원본을 참고해 새로 그리는 것이라 세부가 흔들립니다.
방금 같은 서비스라도 고른 모델에 따라 할 수 있는 일이 다르다고 했습니다. 그리고 앞 절에서는 학습에 천문학적인 비용이 든다고 했습니다. 그 비용을 들여 만든 모델이, 실은 회사마다 하나가 아닙니다. 왜 여러 개를 나란히 내놓는지 다음 절에서 살펴보겠습니다.