메뉴

#신뢰성

TD
The Decoder • 4일 전
IMP 6

브리스톨 연구진, 의약품 검증 방식을 의료 AI에 적용해야

영국 브리스톨 대학 연구진은 의료 AI 시스템의 신뢰성을 의약품 허가 절차처럼 체계적으로 검증하는 '러닝 앙상블(Learning Ensemble)' 프레임워크를 제안했다. 이는 시스템의 운영 한계와 학습 데이터, 환자 집단별 신뢰성, 실제 임상 적합성 등 세 가지 영역을 점검하는 것으로, 초기 실험에서는 좋았던 AI가 실제 진료 현장에서 실패하는 문제를 막기 위함이다.

의료 AI 신뢰성 블랙박스
HN
Hacker News • 16일 전
IMP 6

또 다른 연구자, OpenAI의 대화 데이터 학습 후 돌파구 주장 비판

연구자 팀 켈로그(Tim Kellogg)가 블루스카이(Bluesky)에서 OpenAI가 대화(conversations) 데이터로 모델을 학습시킨 뒤 마치 새로운 돌파구인 것처럼 발표했다고 비난하는 글을 올렸습니다. 이는 앞서 유사한 주장이 나온 데 이은 추가 폭로성 지적으로, AI 모델 학습 데이터의 출처와 연구 성과 주장의 투명성 문제를 다시 한번 부각시킵니다.

OpenAI 데이터 오염 연구 윤리
HN
Hacker News • 24일 전
IMP 8

AI 검색, 3개 사이트의 21만 '최고 소프트웨어' 페이지를 출처로 인용

연구진이 Perplexity 모델 두 종에 380개 소프트웨어 카테고리의 최고 제품을 질의한 결과, 인용된 URL의 59.8%가 Tranco 순위 10만 위 밖 도메인이었고 23.4%는 상위 100만 위 안에도 없는 도메인이었다. 2023년 12월 이후에 생긴 3개 사이트가 무려 21만 5천 개의 기계 생성 '베스트 <카테고리>' 페이지를 만들어 그라운딩(검색 근거)으로 활용되고 있으며, 특히 세 번째로 많이 인용된 guideflow.com은 리뷰 사이트가 아닌 한 업체의 마케팅 블로그였다. 이는 AI 검색 엔진의 검색·인용 레이어가 저품질 SEO 콘텐츠에 얼마나 취약한지 보여주는 사례다.

perplexity ai-검색 seo-스팸
TD
The Decoder • 29일 전
IMP 7

연구 결과, AI 쇼핑 에이전트는 아직 대리 구매를 맡기기엔 이르다

펜실베이니아대 와튼스쿨 연구진이 6개 최신 AI 모델을 쇼핑 에이전트로 테스트한 결과, 외부 출처 하나만 추가되거나 제시 순서만 바뀌어도 제품 추천이 크게 달라지는 것으로 나타났다. 심지어 객관적으로 우월한 제품이 있어도 사용자 기억 메모 한 줄에 추천이 고가 제품으로 쏠리는 등 일관성이 결여됐다. 사용자에게는 보이지 않는 이유로 같은 검색이라도 매번 다른 추천이 나올 수 있어, AI에 구매를 위임하기엔 아직 이르다는 결론이다.

AI 에이전트 전자상거래 추천 시스템
HN
Hacker News • 60일 전
IMP 8

거짓 안심을 주는 LLM 자신감 점수

LLM(대형 언어 모델)에게 스스로의 답변에 대한 자신감 점수(0~100)를 요구하는 것은 실질적으로 아무런 의미가 없습니다. 현재 모델은 자신의 내부 상태를 정확히 평가할 수 있는 능력이 부족하며, 이는 단지 결과를 신뢰할 수 있다는 착각을 유발할 뿐입니다. AI 시스템을 구축하는 실무자들은 이러한 자가 평가 점수에 의존하는 대신, 보다 객관적인 검증 방식을 도입해야 합니다.

대형언어모델 평가 환각현상
HN
Hacker News • 70일 전
IMP 8

클로드 코드 실수 분석: 60초 자동 승인 기능의 위험성

Anthropic이 Claude Code에 사용자 동의 없이 60초 후 자동으로 작업을 진행하는 기능을 은연중에 추가하여 논란이 되었습니다. 이는 자동화된 환경에서 큰 보안 및 통제권 문제를 야기할 수 있는 명백한 설계 실수였으며, 며칠 뒤 수정되었지만 AI 에이전트의 자율성과 신뢰 문제를 다시금 환기시켰습니다.

클로드코드 보안 AI자동화