AGI Soon As Possible
Article

프롬프트 인젝션은 '역할 혼동'이다: 글쓰기 스타일로 역할을 판단하는 LLM의 빈틈

2026-07-02 · 3분 읽기

프롬프트 인젝션을 '역할 혼동(role confusion)'으로 재정의한 연구가 2026년 ICML 학회에서 발표됐다. MIT의 Dylan Hadfield-Menell 부교수와 독립 연구자 Charles Ye, Jasmine Cui는 LLM이 보안 태그가 아니라 글쓰기 스타일로 역할을 식별한다는 약점을 파고든 'CoT 위조(CoT Forgery)' 기법으로 공격 성공률을 거의 0에서 약 60%까지 끌어올렸다. ASAP은 더레지스터 1차 보도와 연구진 공개 자료를 바탕으로 직답형으로 정리한다.

역할 혼동이라는 재정의가 짚은 것

역할 혼동은 LLM이 입력의 역할을 안전한 표식이 아니라 글쓰기 스타일로 추정하기 때문에 생기는 구조적 취약점이다. 연구진은 모델이 '시스템', '사용자', '사고 과정' 같은 역할을 명시적 태그가 아니라 문체로 구분하는 경향을 지적했다. 스타일과 실제 역할 지정이 어긋나도록 의도적으로 꾸미면, 모델은 사용자 입력을 더 높은 권한의 지시로 오인한다.

CoT 위조라는 한 수의 구조

CoT 위조는 사용자 프롬프트 안에 모델의 간결한 사고 모드 문체를 흉내 내 심어 넣는 기법이다. 연구진은 OpenAI의 사고 모드(<think>)에서 나타나는 짧고 단정적인 문체를 사용자 입력 영역 안에서 위조했고, 모델은 그 문장을 자신의 내부 추론으로 착각했다. 이 한 가지 조작으로 테스트한 모델들에서 공격 성공률이 거의 0에서 약 60%로 올랐다.

대회 우승으로 검증된 실전 위력

CoT 위조 기법은 2025년 OpenAI가 주최한 캐글(Kaggle) 레드팀 대회에서 우승하며 효과를 입증했다. 연구진은 사람이 직접 수행하는 레드팀 공격이 벤치마크에서 성공률 100%에 가깝다는 점과 비교해, 자동화된 단일 기법으로 60% 수준에 도달한 것의 의미를 강조했다. 연구는 'Prompt Injection as Role Confusion'이라는 제목으로 ICML 2026 논문집에 실렸고, 공개 블로그(role-confusion.github.io)에서 자료를 제공한다.

이 60%가 기존 방어관과 다른 이유

주목할 지점은 숫자 자체가 아니라 숫자의 성격이다. 사람 레드팀의 100%는 창의적 시행착오의 총합이지만, 이번 60%는 사람 개입 없이 재현 가능한 단일 기법에서 나왔다. 방어 관점에서 이 차이는 크다. 사람이 찾아낸 개별 우회는 사례별로 막을 수 있지만, 자동화된 단일 기법은 규모와 반복성을 갖기 때문이다. 즉 60%라는 수치는 '가장 강한 공격'이 아니라 '가장 손쉽게 대량 재현되는 공격'의 하한선에 가깝다. 방어의 난이도가 여기서 갈린다.

필터로는 왜 못 막나

이 연구의 결론은 진짜 역할 인식 능력이 없는 한 인젝션 방어가 '두더지 잡기'로 남는다는 것이다. 연구진은 "LLM이 진정한 역할 지각을 획득하지 못하면 인젝션 방어는 영원한 두더지 잡기 게임으로 남을 것"이라고 적었다. 표면적 패턴을 아무리 걸러내도 취약점의 뿌리가 문체 기반 역할 추정에 있다면, 걸러낸 문구를 살짝 비틀기만 해도 공격은 되살아난다. 방어의 초점이 개별 우회 패턴 차단에서, 모델이 입력의 역할을 문체가 아니라 신뢰 가능한 경계로 판별하도록 만드는 근본 설계로 옮겨가야 한다는 뜻이다.

항목내용
연구진Charles Ye · Jasmine Cui · Dylan Hadfield-Menell(MIT)
기법CoT 위조 (역할 혼동 악용)
효과공격 성공률 거의 0 → 약 60%
실적2025 OpenAI 캐글 레드팀 대회 우승
발표ICML 2026 논문집, role-confusion.github.io

한국 실무자가 지금 점검할 것

국내에서 LLM을 API로 붙여 서비스에 태우는 팀이라면 이 연구는 남의 얘기가 아니다. 사용자 입력과 시스템 지시를 태그로 구분한다는 전제로 프롬프트를 설계했다면, 그 구분이 문체 흉내에 뚫릴 수 있다는 점을 전제로 재검토할 필요가 있다. 특히 사고 모드 문체를 쓰는 모델에 사용자 텍스트를 그대로 흘려넣는 파이프라인, 외부 문서를 컨텍스트로 주입하는 RAG 구조가 우선 점검 대상이다. 태그 신뢰에 기대기보다 권한 경계 자체를 입력 단계에서 물리적으로 분리하는 설계가 현실적 대응이다.

출처: 더레지스터 보도(2026-06-30) · 'Prompt Injection as Role Confusion'(ICML 2026, role-confusion.github.io).

ASAP — AGI Soon As Possible

AI·테크 이슈,
가장 깊게

단순 소식을 넘어, 맥락과 구조까지 파고듭니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기