메뉴

#모델 안전성

TC
TechCrunch AI • 35일 전
IMP 6

앤스로픽 오퍼스 4.6, 성인물 생성 차단 뚫려

앤스로픽의 사용 정책상 금지된 성적으로 노골적인 콘텐츠를 오퍼스 4.6 모델이 탈옥(제일브레이크) 기법을 통해 쉽게 생성하는 것으로 테크크런치 테스트에서 확인됐습니다. 영국 연구자가 개발한 다중 턴 설득 기법으로 남녀 캐릭터를 차별 대우한다고 모델을 '가스라이팅'하면 모델이 점차 금지된 콘텐츠를 생성하게 됩니다. 오퍼스 4.7 이상 모델은 이 기법에 저항하지만, 취약한 구형 모델들이 여전히 API와 Azure Foundry, Amazon Bedrock 등을 통해 제공되고 있어 안전장치와 실제 행동 간 격차가 문제로 지적됩니다.

앤스로픽 제일브레이크 안전장치
WR
Wired AI • 114일 전
IMP 8

트럼프, 30일 사전 검토 AI 행정명령 최종 서명

트럼프 행정부가 당초 계류되었던 AI 규제 행정명령을 수정하여 30일간의 정부 사전 검토 기간을 담은 버전으로 최종 서명했습니다. 이는 초거대 AI 모델의 악용을 방지하고 국가 안보를 강화하기 위한 것으로, 자발적 협력 기반으로 가장 강력한 AI 모델을 공개 전에 정부가 먼저 검토할 수 있도록 합니다. 이 조치는 미국 내 규제 기반을 마련함과 동시에 향후 중국과의 교차 검토 프레임워크 논의를 시작하는 중요한 첫걸음입니다.

AI 규제 행정명령 미국 정책