메뉴

#평가

HN
Hacker News 1일 전
IMP 8

거짓 안심을 주는 LLM 자신감 점수

LLM(대형 언어 모델)에게 스스로의 답변에 대한 자신감 점수(0~100)를 요구하는 것은 실질적으로 아무런 의미가 없습니다. 현재 모델은 자신의 내부 상태를 정확히 평가할 수 있는 능력이 부족하며, 이는 단지 결과를 신뢰할 수 있다는 착각을 유발할 뿐입니다. AI 시스템을 구축하는 실무자들은 이러한 자가 평가 점수에 의존하는 대신, 보다 객관적인 검증 방식을 도입해야 합니다.

대형언어모델 평가 환각현상
MP
MarkTechPost 27일 전
IMP 7

Lift를 활용한 PDF→구조화 JSON 변환 가이드

이 튜토리얼은 AI 모델 'Lift'를 활용하여 연구 논문 PDF를 구조화된 JSON 데이터로 변환하는 전체 워크플로우를 다룹니다. 단순 데모에 그치지 않고, 의도적인 방해 요소(Distractor)가 포함된 환경에서 스키마 기반 데이터 추출 및 필드 단위 정밀 평가를 수행하여 재현 가능한 벤치마크를 구축하는 과장을 보여줍니다. 실무자들에게 신뢰할 수 있는 데이터 추출 파이프라인을 설계하는 방법을 제시한다는 점에서 중요합니다.

데이터 추출 JSON Lift
TC
TechCrunch AI 33일 전
IMP 8

파트로너스 AI, AI 에이전트 스트레스 테스트 위해 500억 투자 유치

AI 에이전트 평가 스타트업인 파트로너스 AI(Patronus AI)가 가상의 디지털 환경을 구축해 AI 에이전트의 실제 작업 수행 능력을 평가 및 검증하고 있습니다. 이 솔루션은 주요 AI 랩들의 폭발적인 수요를 이끌어내며, 최근 삼성을 비롯한 글로벌 투자자들로부터 5천만 달러(약 680억 원)의 시리즈 B 투자를 유치하는 성과를 냈습니다. 이는 자율주행차를 훈련시키는 것과 같은 원리로, 에이전트가 다양한 환경에서 꼼수를 부리지 않고 안정적으로 작업을 완수하도록 강화학습을 지원하기 때문입니다.

AI 에이전트 평가 벤치마크
TD
The Decoder 39일 전
IMP 8

최신 벤치마크가 폭로한 AI의 실무 한계

인공지능 분석 업체가 공개한 새로운 벤치마크에 따르면, 현재 가장 성능이 좋은 AI 모델조차 복잡한 실무 환경에서는 완벽히 해결하지 못하는 것으로 나타났습니다. 수천 개의 분산된 자료를 종합해야 하는 지식 노동 작업에서 최상위 모델의 완벽한 성공률은 단 3%에 불과했으며, 이는 실제 업무 적용 시 AI의 현재 한계를 명확히 보여줍니다.

벤치마크 지식노동 AI한계
SG
r/singularity 106일 전
IMP 6

영국 AISI, 클로드 미토스 프리뷰 보안 평가 결과

영국 AI 안보연구소(AISI)가 공개한 클로드 미토스 프리뷰(Claude Mythos Preview)의 사이버 역량 평가 결과입니다. 해당 평가를 통해 신형 모델이 네트워크 침투·취약점 분석 등 악의적 사이버 공격에 활용될 가능성을 실험했고, 정부 차원의 안전성 검증이 이뤄졌다는 점에서 중요합니다.

안전성 평가 AISI