자기 압축 에이전트: LLM이 스스로 컨텍스트를 줄여 장기 작업을 버틴다
자기 압축 LLM 에이전트는 컨텍스트를 스스로 요약해 장기 작업에서 토큰 비용을 30~70% 줄이고 정확도까지 끌어올린다. 2026년 6월 22일 공개된 "Self-Compacting Language Model Agents" 논문은 미세조정 없이, 추론 시점에 붙이는 요약 도구와 경량 루브릭만으로 이 효과를 냈다. 핵심은 "요약하는 법"이 아니라 "언제 요약할지"를 모델이 판단하게 만든 데 있다.
한 문장으로
모델이 직접 호출하는 요약 도구와, 발동 시점을 정하는 경량 루브릭을 추론 시점에 결합한다. 루브릭은 하위 작업이 풀렸거나 궤적이 수렴할 때 압축을 켜고, 추론이 진행 중이거나 막힌 상태에서는 억제하라고 지시한다. 미세조정도, 외부 감독도 없이 스캐폴드가 얹는 능력으로 작동한다.
왜 지금 이 문제가 중요한가
에이전트가 코딩·딥리서치·다단계 도구 사용처럼 오래 도는 작업으로 넘어가면서, 컨텍스트 창은 성능이 아니라 비용과 안정성의 병목이 됐다. 대화가 길어질수록 토큰 요금이 선형으로 붙고, 오래된 맥락이 쌓여 모델이 방향을 잃는 "컨텍스트 부패(context rot)"도 심해진다. 그래서 실전 에이전트는 어떤 식으로든 컨텍스트를 줄여야 하는데, 문제는 아무 때나 줄이면 방금 필요한 근거까지 날아간다는 점이다. 이 논문이 겨냥한 건 요약 품질이 아니라 바로 이 타이밍 문제다.
기존 컨텍스트 관리와 무엇이 다른가
지금까지의 접근은 크게 세 갈래였다. 고정 간격 요약은 N턴마다 기계적으로 줄여 필요 없는 순간에도 호출을 낭비하고, 외부 메모리·RAG는 맥락을 밖으로 빼되 무엇을 언제 다시 불러올지가 또 다른 숙제였으며, 압축 특화 모델은 미세조정 비용과 이식성 문제를 안았다. 자기 압축은 이 셋과 달리 판단 자체를 추론 시점의 모델에게 위임한다. 학습을 새로 시키지 않으므로 모델을 갈아끼워도 그대로 얹힌다는 점이 실용적 차별점이다.
숫자를 어떻게 읽을까
성능은 무요약 대비 수학에서 최대 18.1점, 에이전트 검색에서 5~9점 올랐고, 토큰 비용은 고정 간격 요약 대비 문항당 30~70% 낮아졌다. 여기서 주목할 대목은 비용을 깎으면서 정확도도 같이 올랐다는 점이다. 보통 컨텍스트를 줄이면 정확도를 내주는데, 타이밍을 고르니 둘이 상충하지 않았다. 다만 18.1점은 "최대"값이라 과제별 편차가 크다는 뜻이기도 하다. 평균이 아니라 상한이 강조된 수치는 늘 보수적으로 해석하는 편이 안전하다.
한국 개발 현장에 주는 함의
국내 팀 대다수는 프런티어 모델을 API로 호출해 에이전트를 붙이는 구조라, 토큰 30~70% 절감은 곧바로 운영비에 꽂힌다. 특히 사내 문서·코드베이스를 오래 훑는 사내 에이전트나 상담 자동화처럼 세션이 긴 시나리오에서 효과가 크다. 미세조정이 필요 없다는 점도 중요하다. 폐쇄형 API 모델에는 압축 특화 파인튜닝을 적용할 수 없지만, 이 방식은 프롬프트와 도구 정의만으로 얹을 수 있어 오늘 쓰는 스택에 바로 실험해 볼 수 있다.
한계와 열린 질문
이름은 "자기 압축"이지만, 프롬프트 없이 둔 모델은 자기 컨텍스트가 썩는 시점을 스스로 알지 못했다. 결국 성능을 끌어낸 건 모델의 자각이 아니라 사람이 설계한 경량 루브릭이다. 즉 이 방법의 상한은 루브릭이 얼마나 잘 짜였느냐에 걸린다. 검증도 경쟁 수학과 에이전트 검색을 아우르는 6개 벤치마크, 7개 모델로 폭은 넓지만, 코드 리팩터링이나 장기 협업처럼 성공 기준이 모호한 과제에서도 같은 루브릭이 통할지는 아직 열린 질문이다. "언제 압축할지"의 판단을 어디까지 모델에 맡기고 어디부터 규칙으로 못 박을지가 다음 라운드의 승부처가 될 것이다.
정리
Self-Compacting Language Model Agents는 컨텍스트 관리의 초점을 "어떻게 요약하나"에서 "언제 요약하나"로 옮겼다. 미세조정 없이 추론 시점 루브릭만으로 수학 최대 18.1점·검색 5~9점 상승과 토큰 30~70% 절감을 동시에 얻었다는 점이 핵심이며, 그 성과의 열쇠는 모델의 자각이 아니라 발동 시점을 정하는 루브릭 설계에 있다. 장기 에이전트를 만든다면, 압축 기능을 켤지가 아니라 언제 켤지를 먼저 설계해야 한다.
출처: Self-Compacting Language Model Agents (arXiv:2606.23525, 2026년 6월 22일; Tianjian Li, Jingyu Zhang, William Jurayj, Daniel Khashabi 외) 기반 ASAP 분석.

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr