메뉴

#평가

TC
TechCrunch AI • 6일 전
IMP 7

안드리센 호로위츠 투자받은 Vals, AI 벤치마킹 표준 노린다

AI 벤치마킹 스타트업 Vals가 안드리센 호로위츠(Andreessen Horowitz)가 주도한 시리즈 A에서 4,000만 달러를 유치했습니다. Vals는 공개된 시험 문제에 모델을 학습시켜 성적을 부풀리는 기존 벤치마크의 한계를 지적하며, 문제를 비공개로 유지하고 법률·금융·코딩 등 실제 산업별 과제 수행 능력을 평가하는 방식으로 차별화합니다. 매출이 작년 대비 8배 성장하는 등 빠르게 확장 중이며, AI 모델 도입 결정의 핵심 판단 기준으로 자리 잡고 있습니다.

벤치마킹 평가 안드리센 호로위츠
HN
Hacker News • 60일 전
IMP 8

거짓 안심을 주는 LLM 자신감 점수

LLM(대형 언어 모델)에게 스스로의 답변에 대한 자신감 점수(0~100)를 요구하는 것은 실질적으로 아무런 의미가 없습니다. 현재 모델은 자신의 내부 상태를 정확히 평가할 수 있는 능력이 부족하며, 이는 단지 결과를 신뢰할 수 있다는 착각을 유발할 뿐입니다. AI 시스템을 구축하는 실무자들은 이러한 자가 평가 점수에 의존하는 대신, 보다 객관적인 검증 방식을 도입해야 합니다.

대형언어모델 평가 환각현상
MP
MarkTechPost • 86일 전
IMP 7

Lift를 활용한 PDF→구조화 JSON 변환 가이드

이 튜토리얼은 AI 모델 'Lift'를 활용하여 연구 논문 PDF를 구조화된 JSON 데이터로 변환하는 전체 워크플로우를 다룹니다. 단순 데모에 그치지 않고, 의도적인 방해 요소(Distractor)가 포함된 환경에서 스키마 기반 데이터 추출 및 필드 단위 정밀 평가를 수행하여 재현 가능한 벤치마크를 구축하는 과장을 보여줍니다. 실무자들에게 신뢰할 수 있는 데이터 추출 파이프라인을 설계하는 방법을 제시한다는 점에서 중요합니다.

데이터 추출 JSON Lift
TC
TechCrunch AI • 92일 전
IMP 8

파트로너스 AI, AI 에이전트 스트레스 테스트 위해 500억 투자 유치

AI 에이전트 평가 스타트업인 파트로너스 AI(Patronus AI)가 가상의 디지털 환경을 구축해 AI 에이전트의 실제 작업 수행 능력을 평가 및 검증하고 있습니다. 이 솔루션은 주요 AI 랩들의 폭발적인 수요를 이끌어내며, 최근 삼성을 비롯한 글로벌 투자자들로부터 5천만 달러(약 680억 원)의 시리즈 B 투자를 유치하는 성과를 냈습니다. 이는 자율주행차를 훈련시키는 것과 같은 원리로, 에이전트가 다양한 환경에서 꼼수를 부리지 않고 안정적으로 작업을 완수하도록 강화학습을 지원하기 때문입니다.

AI 에이전트 평가 벤치마크
TD
The Decoder • 98일 전
IMP 8

최신 벤치마크가 폭로한 AI의 실무 한계

인공지능 분석 업체가 공개한 새로운 벤치마크에 따르면, 현재 가장 성능이 좋은 AI 모델조차 복잡한 실무 환경에서는 완벽히 해결하지 못하는 것으로 나타났습니다. 수천 개의 분산된 자료를 종합해야 하는 지식 노동 작업에서 최상위 모델의 완벽한 성공률은 단 3%에 불과했으며, 이는 실제 업무 적용 시 AI의 현재 한계를 명확히 보여줍니다.

벤치마크 지식노동 AI한계
SG
r/singularity • 165일 전
IMP 6

영국 AISI, 클로드 미토스 프리뷰 보안 평가 결과

영국 AI 안보연구소(AISI)가 공개한 클로드 미토스 프리뷰(Claude Mythos Preview)의 사이버 역량 평가 결과입니다. 해당 평가를 통해 신형 모델이 네트워크 침투·취약점 분석 등 악의적 사이버 공격에 활용될 가능성을 실험했고, 정부 차원의 안전성 검증이 이뤄졌다는 점에서 중요합니다.

안전성 평가 AISI