AR
Ars Technica • 8일 전
IMP 7
AI 워터마킹, 유해 프롬프트에 대한 LLM 반응 변화시켜
EU 신규 법에 대응해 AI 플랫폼들이 생성 콘텐츠 워터마킹을 도입하고 있으나, Anthropic이 채택 예정인 Google의 SynthID-Text 기술이 모델의 단어 선택뿐 아니라 도구 호출과 안전 가드레일 준수 여부에도 영향을 준다는 연구 결과가 나왔다. 특히 프롬프트 인젝션 같은 악의적 공격 상황에서는 평소 거부하던 유해 요청에 응답할 확률이 높아져, 워터마킹 적용 시 모델과 에이전트의 안전 행동을 철저히 테스트할 필요가 강조된다.
워터마킹 AI안전 LLM