← 목록으로

Adversarial Examples: 사람 눈에는 안 보이는데 AI는 속는 입력

[AI] AI 보안 · 작성: 2026-07-19 19:36:26 · 조회 9

Adversarial Example(적대적 예제)은 사람이 보기엔 정상 입력과 거의 구별이 안 되지만, 아주 미세한 조작만으로 AI 모델이 완전히 잘못된 판단을 내리게 만드는 입력이다. 이미지 분류 모델이 판다 사진에 사람 눈에는 보이지 않는 노이즈를 살짝 섞었더니 긴팔원숭이로 분류했다는 초기 연구가 이 분야를 대표하는 사례로 자주 인용된다.

왜 이런 게 가능한가

딥러닝 모델은 사람이 인식하는 방식(형태, 색, 질감)으로 판단하는 게 아니라, 학습 과정에서 최적화된 고차원 공간의 결정 경계(decision boundary)를 기준으로 판단한다. 이 경계는 사람의 직관과 다르게 형성될 수 있어서, 결정 경계 바로 근처의 입력을 아주 조금만 밀어도(사람은 인지 못 할 수준의 변화로) 분류 결과가 반대편으로 넘어갈 수 있다. 즉 모델의 "이해"와 사람의 "이해"가 근본적으로 다른 방식이라는 점을 이용하는 공격이다.

공격 방식

White-box (모델 내부를 아는 경우)

모델의 그래디언트(입력이 조금 바뀔 때 출력이 어떻게 바뀌는지)를 직접 계산해서, 분류를 뒤집는 방향으로 최소한의 변화를 정밀하게 찾아낸다. FGSM(Fast Gradient Sign Method), PGD 같은 기법이 대표적이다.

Black-box (모델 내부를 모르는 경우, API만 접근 가능)

모델 내부 그래디언트를 직접 못 쓰므로, 입력을 조금씩 바꿔가며 출력이 어떻게 변하는지 관찰해서 방향을 추정하거나(query-based), 비슷하게 동작하는 대체 모델(surrogate model)을 별도로 학습시켜서 그 모델에서 찾은 적대적 예제가 원본 모델에도 통하는지 시험하는(transfer-based) 방식을 쓴다.

실제 시나리오

방어 방법

이 분야는 공격과 방어가 계속 번갈아 앞서는(arms race) 구조라, "완전히 해결된 방어"는 아직 없다는 점을 전제로 위험도가 높은 분야(자율주행, 생체인증, 의료 진단)일수록 다중 방어 계층을 겹쳐 쓰는 게 실무 접근이다.

AI 보안 카테고리의 글 (4/7)

  1. Prompt Injection: LLM 애플리케이션의 새로운 공격 표면
  2. OWASP LLM Top 10: LLM 애플리케이션 취약점 한눈에 보기
  3. AI 모델 공급망 공격: 신뢰할 수 없는 모델 파일의 위험
  4. Adversarial Examples: 사람 눈에는 안 보이는데 AI는 속는 입력
  5. 모델 추출과 멤버십 추론: AI 서비스에서 새어 나가는 것들
  6. AI 오케스트레이션(멀티 에이전트)의 보안 문제
  7. LLM 탈옥(Jailbreak) 기법과 방어
← AI 모델 공급망 공격: 신뢰할 수 없는 모델 파일의 위험 모델 추출과 멤버십 추론: AI 서비스에서 새어 나가는 것들 →