Prompt Injection 글에서 "외부 콘텐츠에 악성 지시가 섞여 들어가는" 공격을 다뤘다면, Jailbreak는 조금 다르다 — 사용자가 직접, 모델에 걸린 안전 정책(시스템 프롬프트·RLH…
2026-07-20 03:10:34 · 조회 3LLM 하나가 질문에 답하는 걸 넘어, 여러 에이전트가 서로 도구를 호출하고 서로의 결과를 넘겨받으며 작업을 나눠 처리하는 멀티 에이전트/오케스트레이션 구조가 빠르게 늘고 있다. 에이전트 하나하나는…
2026-07-19 19:41:12 · 조회 5Prompt Injection은 LLM(대형 언어모델)에 원래 개발자가 의도하지 않은 지시를 사용자 입력을 통해 주입해서, 모델이 시스템 프롬프트의 지시를 무시하고 공격자가 원하는 대로 동작하게 만…
2026-07-19 19:36:26 · 조회 2OWASP는 웹 애플리케이션 Top 10으로 유명한 재단인데, LLM을 활용한 애플리케이션이 급증하면서 별도로 "OWASP Top 10 for LLM Applications"를 만들었다. 전통적인 …
2026-07-19 19:36:26 · 조회 1모델 파일을 다운로드해서 그대로 로드하는 행위가, 신뢰할 수 없는 실행 파일을 다운로드해서 실행하는 것과 본질적으로 다르지 않을 수 있다는 게 이 공격 클래스의 핵심이다. "그냥 가중치(weight…
2026-07-19 19:36:26 · 조회 1Adversarial Example(적대적 예제)은 사람이 보기엔 정상 입력과 거의 구별이 안 되지만, 아주 미세한 조작만으로 AI 모델이 완전히 잘못된 판단을 내리게 만드는 입력이다. 이미지 분류…
2026-07-19 19:36:26 · 조회 8AI 모델을 API 형태로만 서비스하고 가중치는 절대 공개하지 않아도, 그 API에 충분히 많은 질의를 던지는 것만으로 모델의 내부 정보나 학습 데이터의 일부가 새어 나갈 수 있다. 이 글은 이런 …
2026-07-19 19:36:26 · 조회 1