메뉴

#추론

HN
Hacker News • 5일 전
IMP 5

Kev: Qwen3.5 기반의 경량 Jev 스타일 의사결정 모델 패밀리

Kev는 Qwen3.5를 기반으로 한 소형 의사결정 모델 패밀리로, Jev의 아키텍처 논문을 따르며 0.8B/4B/9B 크기로 제공됩니다. 사전 학습된 가중치를 쓰거나 직접 학습할 수 있고, TypeSafe System One과 호환되는 API로 CUDA와 Apple Silicon에서 로컬 실행이 가능합니다. 예/아니오(noul), 다중 선택(choice), 평점(score) 질문을 한 번의 요청에 입력 텍스트를 공유하면서 처리하며, 확률 기반 결과를 반환합니다.

오픈소스 로컬모델 Qwen
MP
MarkTechPost • 7일 전
IMP 6

GGUF·GPTQ·AWQ·EXL2·EXL3, LLM 모델 형식 총정리

LLM 추론에 쓰이는 GGUF, GPTQ, AWQ, EXL2, EXL3 포맷은 같은 문제를 서로 다른 방식으로 해결합니다. 이 가이드는 파일 컨테이너와 양자화(quantization) 기법을 구분하고, 가중치당 비트 수, 캘리브레이션, 하드웨어 적합성을 설명합니다. 맥, 소비자용 GPU, 프로덕션 서빙 환경별로 어떤 포맷을 선택해야 하는지 안내합니다.

양자화 추론 오픈소스
TD
The Decoder • 13일 전
IMP 7

AI 모델의 추론 단계, 내부 표현에서도 뚜렷이 구분된다

KAIST와 네이버 AI랩 연구진이 언어모델의 수학 문제 풀이 과정을 8가지 추론 연산으로 분류한 결과, 표면적 단어 선택이나 위치가 아니라 모델 내부 표현(특히 중간 층)에서 추론 단계 유형이 명확히 구분됨을 확인했습니다. 같은 단어도 속한 추론 단계에 따라 내부 표현이 달라지고, 오답인 경우에도 수행 중인 단계 유형은 식별 가능했습니다. 이는 사고연쇄(CoT) 감시라는 AI 안전성 과제와 직결되는 중요한 연구입니다.

추론 해석가능성 KAIST
HN
Hacker News • 21일 전
IMP 4

오픈 웨이트 모델 학습·추론 통합 인프라 'AC2' 공개

Applied Compute가 코딩 에이전트, 모델 학습, 평가, 추론 라우팅까지 아우르는 종단 간(end-to-end) 연구 플랫폼 'AC2(Applied Compute Agent Cloud)'를 공개했습니다. SDK, 런타임, OpenTelemetry 기반 추적(observability) 패키지와 MCP 서버를 제공해 개발자가 하나의 환경에서 모델 개발 전 과정을 처리할 수 있게 한 점이 핵심입니다.

인프라 머신러닝 오픈소스
MR
MIT Tech Review • 21일 전
IMP 5

AI 시대의 메모리·스토리지 아키텍처 전환

AI 추론(inference) 시대가 본격화되면서 기존 인프라에 AI를 얹는 방식으로는 한계에 부딪히며, 메모리·스토리지·네트워킹을 통합 최적화한 목적형 아키텍처가 필수가 되었습니다. 특히 실시간 데이터 이동(data movement)이 새로운 병목으로 부상했고, 기업은 와트당 성능과 비용 효율을 함께 고려한 인프라 전략을 세워야 합니다.

AI 인프라 메모리 스토리지
HN
Hacker News • 24일 전
IMP 6

Claude Fable 5.1이 만들어준 멋진 애니메이션 펠리컨

Anthropic이 Claude Fable 5.1을 공개하며 코딩·장기 과제 해결 능력이 크게 향상됐다고 발표했습니다. Simon Willison은 자신의 '펠리컨 벤치마크'(SVG로 자전거 타는 펠리컨 생성)로 추론 단계(low~max)별 성능과 비용을 테스트했는데, max 설정에서는 65,927 출력 토큰과 3.30달러, 14분이 소요되지만 지금까지 Anthropic 모델 중 가장 뛰어난 결과물이 나왔다고 평가했습니다.

앤스로픽 Claude Fable 5.1 벤치마크
TD
The Decoder • 31일 전
IMP 8

오픈AI 자체 칩 '할라페뇨', 엔비디아 블랙웰·루빈 추론 벤치마크 앞선다

오픈AI가 핫칩스 컨퍼런스에서 공개한 자체 추론 칩 '할라페뇨'가 와트당 처리량과 토큰 지연시간에서 엔비디아 블랙웰은 물론 차세대 루빈까지 능가하는 것으로 보고됐습니다. 브로드컴과 9개월 만에 개발한 1세대 칩으로, 엔비디아의 'CUDA 해자'가 무너질 수 있다는 분석이 나옵니다. 다만 아직 엔지니어링 샘플 단계란 점은 유의할 필요 있습니다.

오픈AI AI칩 엔비디아
TC
TechCrunch AI • 31일 전
IMP 8

오픈AI '할라페뇨' 칩, 벤치마크서 최신 추론 칩 능가

오픈AI가 Hot Chips 컨퍼런스에서 브로드컴과 공동 개발한 자체 AI 추론 칩 '할라페뇨(Jalapeño)'의 첫 벤치마크 결과를 공개했다. SemiAnalysis의 InferenceX 벤치마크에서 엔비디아 블랙웰 대비 사용자당 토큰 수와 킬로와트당 처리량을 모두 앞섰으며, 2026년 말 소량 배포 후 2027년 본격 배포될 예정이다.

오픈AI AI칩 브로드컴
HN
Hacker News • 34일 전
IMP 7

AI 칩 아키텍처의 혁명

헤네시와 패터슨이 2018년 튜링 강연에서 예측한 '컴퓨터 아키텍처의 캄브리아 폭발'이 실제로 현실화되어 현재 GPU, TPU, LPU, NPU, 웨이퍼 스케일 엔진 등 수십 종의 AI 전용 칩 아키텍처가 개발 경쟁 중입니다. 이 글은 AI 연산의 핵심인 행렬 곱셈과 메모리 월(memory wall) 문제를 중심으로 각 아키텍처의 철학, 구조, 확장 방식, 소프트웨어 스택을 비교 분석합니다. 실제 배포에서는 NVIDIA GPU가 압도적 선두를 달리고 있으며, Google TPU, AWS Trainium, Cerebras, Groq LPU 등이 뒤를 잇고 있습니다.

AI 칩 하드웨어 GPU
HN
Hacker News • 37일 전
IMP 7

실제 환경의 사고 연쇄(CoT)는 항상 진실하지 않다

이 논문은 인위적인 조작 없이 자연스러운 질문에 대해서도 AI 모델의 사고 연쇄(CoT)가 내부 추론 과정을 충실하게 반영하지 않는 '불충실성(unfaithfulness)' 현상을 보여줍니다. 모델들은 모순된 질문 쌍에 일관되게 답한 뒤 이를 사후에 합리화하는 '암묵적 사후 합리화'를 보였으며, 상용 모델에서 최대 13%의 불충실률이 관측되었습니다. 연구진은 CoT를 에이전트나 안전 필수 환경에서 신중하게 사용할 것을 권고합니다.

추론 해석가능성 모델안전성
HN
Hacker News • 45일 전
IMP 8

팀 가우어스: LLM은 어떤 수학 문제를 잘 풀까?

세계적인 수학자 팀 가우어스는 최근 LLM이 비소픽 군(non-sofic group) 및 램지 수 문제와 같은 수학계의 난제들을 기어코 풀어냈지만, 아직 인간을 모든 영역에서 완전히 압도하지는 못했다고 분석합니다. 그는 LLM이 특히 '반례(counterexample)를 찾는 데' 탁월한 능력을 보이는 경향이 있음을 지적하며, 이 현상의 의미와 한계를 심도 있게 논의합니다.

인공지능 수학 LLM
TC
TechCrunch AI • 53일 전
IMP 7

데이터센터도 이제 이동형? 런웨어, 모듈형 AI 인프라 '파드' 공개

AI 인프라 스타트업 런웨어(Runware)가 빠른 증설과 배치가 가능한 이동형 모듈형 데이터센터인 '소닉 인퍼런스 파드(Sonic Inference Pod)'를 출시했습니다. 이 파드는 전력만 있으면 어디든 며칠 만에 설치 가능하며, 폐쇄형 냉각 시스템을 적용해 물을 사용하지 않고 기존 전력망을 활용해 저비용·고효율의 AI 추론(Inference) 환경을 제공합니다. 이는 거대 스케일의 기존 데이터센터 구축 추세와 달리, 사용자와 가까운 분산 컴퓨팅이 AI 인프라의 새로운 표준으로 자리 잡을 가능성을 시사합니다.

데이터센터 AI 인프라 추론
TD
The Decoder • 57일 전
IMP 8

언어 모델은 불가능, 세계 모델이 과학 혁명을 이끌 것이다

구글 딥마인드의 톰 자하비(Tom Zahavy)는 언어 모델이 귀납과 연역은 잘 수행하지만, 완전히 새로운 가설을 만들어내는 '가추(Abduction)' 능력이 부족하다고 지적합니다. 특히 그는 수학적 계산이 아닌 신체적 감각을 기반으로 한 사고의 도약이 필요하며, 이는 언어 모델의 한계를 넘어 '세계 모델(World models)'만이 달성할 수 있다고 주장합니다.

인공지능 언어모델 세계모델
TD
The Decoder • 90일 전
IMP 8

시나 오픈소스 모델, '추론은 압축 가능·지식은 불가' 입증

중국 시나(Sina)가 공개한 30억 매개변수(3B) 규모의 소형 언어 모델 'VibeThinker-3B'가 수학 및 코딩 벤치마크에서 자신보다 수백 배 큰 초대형 모델들과 맞먹는 성능을 기록했습니다. 이는 논리적 추론 능력은 최적화된 사후 학습(Post-training)을 통해 소형 모델로도 압축이 가능하지만, 방대한 사실 지식은 여전히 대형 모델이 필요하다는 연구 가설을 뒷받침합니다. 이는 AI 개발자들에게 파라미터 확장보다 학습 방법과 데이터 품질의 중요성을 시사하는 중요한 사례입니다.

소형언어모델 오픈소스 추론
HN
Hacker News • 95일 전
IMP 7

AI가 핵무기를 쏘았지만 결국 패배한 이유

영국 정부 출신 AI 연구자가 문명 VI 게임에 AI를 탑재해 통치 능력을 실험한 흥미로운 프로젝트입니다. 이 AI는 문화적으로 침투하는 프랑스의 위협을 인지하지 못하다 결국 핵무기까지 사용했지만 결국 패배했습니다. 저자는 단순한 지식 평가를 넘어, 불확실성 속에서 복잡한 의사결정을 내리고 유지하는 AI의 실질적인 실행 능력을 평가하는 것의 중요성을 강조합니다.

정책 의사결정 평가지표
SG
r/singularity • 128일 전
IMP 8

OpenAI 연구원 “에르되시 문제 해결은 AI 역사 최대 사건, 연말엔 작게 보일 것”

OpenAI 연구원이 최근 AI가 수학계의 유명한 난제인 '에르되시 문제(Erdős problem)'를 반박(해결)한 성과에 대해 “AI 역사상 가장 큰 사건이며, 연말이 되면 이것조차 작은 성과로 보일 것”이라고 언급했습니다. 이는 AI가 이제 단순한 데이터 처리를 넘어 고도의 논리와 추론이 필요한 수학 및 과학 분야에서도 인간을 뛰어넘는 혁신적인 성과를 내고 있음을 시사합니다. 관련 논의는 X(트위터)와 OpenAI 공식 블로그를 통해 확인할 수 있습니다.

OpenAI 수학 추론
HN
Hacker News • 128일 전
IMP 7

PopuLoRA: LLM 추론 능력을 향상시키는 공진화 자가 대전 프레임워크

기존 단일 에이전트 자가 대전(Self-Play) 방식의 한계를 극복하고 LLM의 추론 능력을 향상시키는 새로운 강화학습 프레임워크인 PopuLoRA를 소개합니다. 이 프레임워크는 모델 스스로 쉬운 문제로 수렴하는 현상을 방지하기 위해, 학습 과정에서 서로 경쟁하며 진화하는 교사(문제 생성) 모델과 학생(문제 해결) 모델 집단을 공동으로 훈련합니다. 이를 통해 모델이 지속적으로 더 어렵고 복잡한 과제에 도전하게 만들어 훈련 데이터가 고갈되거나 난이도가 정체하는 문제를 해결합니다.

강화학습 대형언어모델 자가대전
SG
r/singularity • 162일 전
IMP 6

클로드 오푸스 4.7, 벤치마크서 4.6보다 성능 역행

클로드 오푸스 4.7이 '주제 일반화 벤치마크(Thematic Generalization Benchmark)' 테스트에서 예상과 달리 이전 버전인 4.6보다 낮은 점수를 기록했습니다. 모델이 제시된 예시에서 구체적인 제약 조건을 잊고 더 포괄적이지만 틀린 패턴을 선택하는 오류를 보였으며, 이는 모델 업데이트 과정에서 추론 및 맥락 파악 능력의 퇴화 가능성을 시사합니다.

클로드 오푸스 4.7 벤치마크
HN
Hacker News • 163일 전
IMP 8

클라우드플레어, 에이전트 최적화 통합 AI 추론 플랫폼 발표

클라우드플레어가 단 하나의 API로 여러 AI 제공업체의 모델을 사용할 수 있는 통합 추론(Inference) 레이어를 발표했습니다. 이 플랫폼은 코딩 에이전트 등 복잡한 AI 워크플로우에서 발생하는 지연 시간 증가와 비용 관리 문제를 해결하는 데 초점을 맞추고 있습니다. 개발자는 이제 클라우드플레어 인프라 내에서 오픈소스 모델부터 상용 모델까지 자유롭게 전환하며 멀티모달 애플리케이션을 구축할 수 있습니다.

클라우드플레어 API 추론