TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 23 READS

이미지로 압축한 텍스트, 필요한 곳만 펼쳐 읽는다 — LensVLM의 접근

이미지로 압축한 텍스트, 필요한 곳만 펼쳐 읽는다 — LensVLM의 접근
SOURCE IMAGE · HACKER NEWS

긴 문서를 그대로 언어 모델에 넣으면 토큰 수가 폭발한다. 이 비용 문제를 우회하는 한 가지 아이디어가 텍스트를 '토큰'이 아니라 '렌더링된 이미지'로 처리하는 것이다. 비전-언어 모델(VLM)은 글자가 적힌 화면 이미지를 그대로 입력받아 처리할 수 있고, 이렇게 하면 텍스트를 수천 개의 토큰으로 쪼개는 과정을 건너뛸 수 있다. LensVLM은 바로 이 경로를 실용적인 수준까지 끌어올리려는 시도다. Qwen3.5-9B-Base를 기반으로 만들어졌으며, 추론 프레임워크와 사후 학습(post-training) 레시피를 함께 제안한다.

해상도가 곧 압축 손잡이다

핵심은 VLM의 이미지 인코더가 작동하는 방식에 있다. 이미지 인코더는 고정된 크기의 이미지를 정해진 개수의 시각 토큰으로 매핑한다. 즉 같은 분량의 텍스트를 더 낮은 해상도로 렌더링해 한 장에 욱여넣으면, 같은 토큰 수 안에 더 많은 글자를 담을 수 있다. 렌더링 해상도가 사실상 압축률을 세밀하게 조절하는 손잡이가 되는 셈이다. 문제는 압축을 높일수록 정확도가 빠르게 무너진다는 점이다. 글자가 인코더가 구분할 수 있는 유효 해상도 아래로 작아지면, 모델 입장에서는 글자들이 서로 뭉개져 읽을 수 없는 상태가 된다.

일반적인 대응은 해상도를 넉넉하게 유지하는 것이지만, 그러면 애초에 노렸던 토큰 절감 효과가 사라진다. 결국 '압축을 세게 걸면 못 읽고, 읽으려면 압축을 못 건다'는 딜레마가 생긴다. LensVLM은 이 지점을 정면으로 겨냥한다.

훑어보고, 필요한 부분만 확대한다

LensVLM의 동작 방식은 사람이 축소된 문서 지도를 훑다가 관심 영역만 돋보기로 확대하는 것과 닮았다. 먼저 강하게 압축된 이미지를 스캔해 전체 구조를 파악한 뒤, 학습된 '도구(tool)'를 통해 실제로 관련 있는 부분만 선택적으로 원본 해상도로 펼쳐 읽는다. 문서 전체를 고해상도로 처리하는 대신, 답을 내는 데 필요한 조각만 비용을 들여 확대하는 것이다. 이 선택적 확장 능력이 프레임워크와 사후 학습 레시피의 중심에 있다.

성능 측면에서 제시된 수치는 두 가지다. 하나는 4.3배의 유효 압축률에서 전체 텍스트를 그대로 넣었을 때(상한선)에 필적하는 정확도를 유지한다는 것이고, 다른 하나는 최대 10.1배의 유효 압축률까지 검색 기반(retrieval) 방식, 텍스트 압축 방식, 시각 압축 방식 등 여러 베이스라인을 능가한다는 것이다. 이 비교는 일곱 개의 텍스트 QA 벤치마크에서 이뤄졌다. 또한 순수 텍스트 QA를 넘어 멀티모달 문서 이해와 코드 이해 과제로도 일반화되며, 흥미롭게도 압축률이 높아질수록 베이스라인 대비 정확도 격차가 오히려 벌어진다고 보고한다.

왜 작동하는가, 그리고 어디까지인가

저자들의 분석은 두 가지를 짚는다. 첫째, 학습을 거치면 시각 압축이 렌더링 방식의 선택에 대해 견고해진다. 폰트나 렌더링 조건 같은 변수에 덜 흔들린다는 뜻이다. 둘째, 압축률이 커질수록 모델은 신뢰하기 어려운 '시각적 읽기'에 의존하기보다 확장된(펼친) 콘텐츠에 점점 더 의존하게 된다. 다시 말해 강한 압축 상황에서는 흐릿한 이미지를 억지로 해독하려 들지 않고, 확대 도구를 적극적으로 호출하는 쪽으로 행동이 바뀐다는 것이다. 이 관찰은 성능이 무너지지 않는 이유를 설명해 준다.

실무자 관점에서 이 접근이 매력적인 이유는 분명하다. 긴 컨텍스트를 다뤄야 하는데 토큰 비용이 부담스러운 시나리오—대용량 문서 질의응답, 코드베이스 이해, 스캔 문서 처리—에서 이미지 기반 표현은 토큰 예산을 크게 줄일 여지를 준다. 특히 '전부 고해상도'와 '전부 저해상도'라는 양자택일 대신, 질의에 따라 확대 대상을 동적으로 고르는 구조는 비용과 정확도의 균형점을 상황에 맞게 옮길 수 있게 해준다.

다만 한계도 함께 봐야 한다. 제시된 결과는 특정 벤치마크군과 하나의 기반 모델(Qwen3.5-9B-Base) 위에서 얻은 것으로, 도구 호출을 학습시키는 사후 학습 과정과 추론 시 확장 단계가 추가로 필요하다는 점에서 구현 부담이 있다. 선택적 확장은 결국 '무엇을 펼칠지'를 잘 고르는 능력에 성능이 좌우되며, 관련 영역을 놓치면 답도 놓친다. 또한 원문은 실제 도구 선택에 대한 실용적 지침을 제시한다고 언급하지만 구체적인 권고 내용까지는 공개된 요약에 담겨 있지 않아, 실제 적용 전에는 논문 본문과 재현 가능한 구현 세부를 직접 확인하는 편이 안전하다. 텍스트를 이미지로 다루는 이 흐름이 범용적으로 자리 잡을지는 더 다양한 모델과 과제에서의 검증에 달려 있다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://huggingface.co/papers/2605.07019
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...