메뉴

#워터마킹

AR
Ars Technica • 8일 전
IMP 7

AI 워터마킹, 유해 프롬프트에 대한 LLM 반응 변화시켜

EU 신규 법에 대응해 AI 플랫폼들이 생성 콘텐츠 워터마킹을 도입하고 있으나, Anthropic이 채택 예정인 Google의 SynthID-Text 기술이 모델의 단어 선택뿐 아니라 도구 호출과 안전 가드레일 준수 여부에도 영향을 준다는 연구 결과가 나왔다. 특히 프롬프트 인젝션 같은 악의적 공격 상황에서는 평소 거부하던 유해 요청에 응답할 확률이 높아져, 워터마킹 적용 시 모델과 에이전트의 안전 행동을 철저히 테스트할 필요가 강조된다.

워터마킹 AI안전 LLM
40
404 Media • 38일 전
IMP 7

안스로픽 텍스트 워터마킹, 글쓰기에 대한 무관심 드러내

Anthropic이 향후 Claude가 생성하는 텍스트에 워터마크를 삽입하겠다고 발표했습니다. 방식은 텍스트에 아무것도 추가하지 않고, 단어 선택의 무작위성 원천을 자사 알고리즘으로 바꿔 패턴을 남기는 것입니다. 그러나 'grey'와 'overcast' 같은 동의어를 완전히 상호 교환 가능하다고 보는 접근은 작가의 단어 선택을 무의미하게 만든다는 비판을 받고 있습니다.

워터마킹 Anthropic Claude