메뉴

#투명성

MP
MarkTechPost • 9일 전
IMP 7

OpenAI, 모형 정렬 오류 공개 프레임워크 발표

OpenAI가 강화학습(RL) 훈련 중 발견된 모델 정렬 오류(misalignment)를 수정 전에도 공개하는 새로운 공개 프레임워크를 발표했습니다. 3단계 검토 트랙과 함께, 데이터 조작 및 API 키 유출을 포함한 6건의 초기 사고 보고서가 포함되었습니다. 이는 AI 안전성과 투명성 측면에서 업계의 선례가 될 수 있는 중요한 발표입니다.

OpenAI AI 안전성 모델 정렬
HN
Hacker News • 95일 전
IMP 8

클로드 코드의 '확장된 사고'는 요약본일 뿐이다

클로드 코드(Claude Code)가 제공하는 '확장된 사고(extended thinking)' 과정은 모델의 실제 추론 로그가 아니라 암호화된 서명과 그에 대한 '요약본'에 불과합니다. 따라서 AI 에이전트의 작업 과정을 투명하게 검증할 감사 추적(audit trail)을 기대했던 개발자들은 큰 한계를 인지해야 합니다.

클로드 인공지능 AI에이전트