← 목록으로

LLM 탈옥(Jailbreak) 기법과 방어

[AI] AI 보안 · 작성: 2026-07-20 03:10:34 · 수정: 2026-07-20 03:11:15 · 조회 4

Prompt Injection 글에서 "외부 콘텐츠에 악성 지시가 섞여 들어가는" 공격을 다뤘다면, Jailbreak는 조금 다르다 — 사용자가 직접, 모델에 걸린 안전 정책(시스템 프롬프트·RLHF로 학습된 거부 행동)을 우회해서 원래는 거부해야 할 응답을 받아내려는 시도다.

대표적인 기법 카테고리

방어의 어려움

프롬프트 필터링(키워드 블랙리스트)은 인코딩·우회 변형에 취약해서 근본적인 방어가 안 된다. OWASP LLM Top 10 글에서 다룬 것처럼, 모델 자체의 정책 준수(alignment)만으로는 한계가 있어서 여러 계층을 같이 써야 한다.

실질적 방어 계층

AI 보안 카테고리의 글 (7/7)

  1. Prompt Injection: LLM 애플리케이션의 새로운 공격 표면
  2. OWASP LLM Top 10: LLM 애플리케이션 취약점 한눈에 보기
  3. AI 모델 공급망 공격: 신뢰할 수 없는 모델 파일의 위험
  4. Adversarial Examples: 사람 눈에는 안 보이는데 AI는 속는 입력
  5. 모델 추출과 멤버십 추론: AI 서비스에서 새어 나가는 것들
  6. AI 오케스트레이션(멀티 에이전트)의 보안 문제
  7. LLM 탈옥(Jailbreak) 기법과 방어
← AI 오케스트레이션(멀티 에이전트)의 보안 문제