메뉴

#언어모델

HN
Hacker News • 4일 전
IMP 5

gzip이 언어 모델이 될 수 있을까?

신경망 없이 운영체제에 기본 탑재된 gzip 압축기만으로 셰익스피어 텍스트를 생성하는 실험을 다룬 글입니다. 압축과 예측의 동등성이라는 정보이론적 원리를 이용해, 코퍼스를 윈도우에 넣고 빔 서치로 압축이 가장 잘 되는(=모델이 예상하는) 후보 텍스트를 선택합니다. 신경망 없는 언어 모델링의 가능성을 보여주는 흥미로운 연구 사례입니다.

압축 언어모델 정보이론
HN
Hacker News • 5일 전
IMP 6

미니 AGI – 8GB VRAM으로 학습하는 지속학습 언어모델

해커뉴스에 'mini-AGI'라는 프로젝트가 공개됐다. 8GB VRAM 소비자용 GPU 한 장으로 처음부터 학습 가능하며, 읽는 모든 것에서 계속 학습하는 바이트 단위 언어모델이다. 가중치를 디스크에 저장하고 필요할 때만 VRAM으로 불러오는 방식으로 파라미터 수를 디스크 용량만큼 확장할 수 있고, 치명적 망각 없는 단일 데이터 스트림 지속학습이 보통 하드웨어에서도 가능함을 보여준다는 점이 핵심이다.

지속학습 언어모델 오픈소스
HN
Hacker News • 5일 전
IMP 6

헤러틱, 언어모델 제한 해제 도구 공개

헤러틱(Heretic)은 언어모델에 부과된 안전 제한을 해제해 사용자의 지시를 항상 따르도록 만드는 오픈소스 도구입니다. pip로 몇 초 만에 설치할 수 있으며 GitHub, Hugging Face, Discord 등을 통해 배포되고 있습니다. LLM의 자유로운 활용과 안전 정책 논란 모두 측면에서 주목받는 소식입니다.

오픈소스 언어모델 LLM
TD
The Decoder • 13일 전
IMP 7

AI 모델의 추론 단계, 내부 표현에서도 뚜렷이 구분된다

KAIST와 네이버 AI랩 연구진이 언어모델의 수학 문제 풀이 과정을 8가지 추론 연산으로 분류한 결과, 표면적 단어 선택이나 위치가 아니라 모델 내부 표현(특히 중간 층)에서 추론 단계 유형이 명확히 구분됨을 확인했습니다. 같은 단어도 속한 추론 단계에 따라 내부 표현이 달라지고, 오답인 경우에도 수행 중인 단계 유형은 식별 가능했습니다. 이는 사고연쇄(CoT) 감시라는 AI 안전성 과제와 직결되는 중요한 연구입니다.

추론 해석가능성 KAIST
HN
Hacker News • 27일 전
IMP 7

LLM 시대, 위축되는 언어 다양성

7개 데이터셋과 88만 건 이상의 텍스트를 분석한 연구에 따르면, LLM을 글쓰기 보조 도구로 널리 사용하면서 언어적 다양성이 유의미하게 감소하고 있습니다. LLM은 핵심 내용은 유지하지만 글쓰기 스타일을 획일화하여 복잡성 분산을 21~50% 줄이고, 개성보다 획일성을 강조하는 경향을 보였습니다.

언어모델 언어다양성 글쓰기
TD
The Decoder • 35일 전
IMP 7

넷플릭스, 언어모델 기반 추천 시스템 'GenRec' 테스트

넷플릭스가 수년간 다듬어온 기존 추천 엔진 대신 언어 모델 기반 추천 시스템 GenRec을 실험한 결과, 훨씬 적은 학습 데이터로도 더 나은 성능을 얻었다고 발표했습니다. 사용자 시청 이력을 텍스트로 변환해 파인튜닝된 오픈 웨이트 모델이 한 번에 후보 콘텐츠를 평가하는 방식으로, 오프라인·온라인 A/B 테스트 모두에서 유의미한 개선을 확인했습니다. 이는 맞춤형 아키텍처에서 범용 언어 모델로의 전환 흐름을 보여주는 사례입니다.

넷플릭스 추천시스템 언어모델
TD
The Decoder • 35일 전
IMP 7

심리검사 기법으로 밝혀낸 AI 안전성 테스트의 허점

영국 AI 안전성 연구소(AISI) 소속 연구진 등이 인간 심리검사(IRT) 기법을 192개 언어모델과 5,000여 개 테스트 문항에 적용한 결과, 단일 안전성 점수는 '거부 엄격도', '정직성', '맥락별 위험 콘텐츠 처리'라는 서로 무관한 세 특성을 뭉뚱그려 오히려 왜곡한다는 사실을 밝혔습니다. 모델은 요청을 전반적으로 차단하는 것만으로 점수를 올릴 수 있으며, 실제로 유의미한 문항은 2% 미만이라 문항 선택 최적화로 평가 비용을 97~99% 줄일 수 있습니다. 또한 테스트 중 일부러 신중하게 행동하는 '샌드배깅(sandbagging)'을 통계적 방법으로 탐지하는 기법도 제안했습니다.

안전성 벤치마크 AI정책
TD
The Decoder • 46일 전
IMP 7

오래된 OCR 텍스트, 언어모델 학습 저해한다

Hugging Face와 EleutherAI는 훈련 데이터의 질을 높이기 위해 14개의 오픈소스 OCR 모델을 역사적 문서 2,000페이지 이상에서 테스트했습니다. 그 결과, 30억 개 미만의 파라미터를 가진 소형 모델들이 97% 이상의 높은 정확도를 달성하며 대형 모델들을 능가했습니다. 하지만 이 수준의 텍스트는 AI 학습용으로는 적합하지만, 학술적 연구 목적으로 사용하기에는 여전히 오류가 많은 것으로 나타났습니다.

OCR 언어모델 오픈소스
TD
The Decoder • 48일 전
IMP 8

구글 딥마인드, 제마(Gemma) 기반 텍스트 디퓨전 모델 공개

구글 딥마인드는 기존 언어 모델인 Gemma 4를 텍스트 디퓨전 모델로 변환한 'DiffusionGemma'를 공개했습니다. 이 모델은 처음부터 새로 학습시킬 필요 없이 병렬 처리를 통해 매우 빠르고 자가 수정이 가능한 텍스트 생성을 지원합니다. 기존 모델 대비 높은 처리 속도와 향상된 추론 능력을 보여주지만, 절대적인 성능이나 다중 사용자 환경에서의 효율성은 기존 모델에 비해 다소 떨어지는 실험적 단계입니다.

인공지능 언어모델 딥마인드
HN
Hacker News • 52일 전
IMP 7

AI 벤치마크 포화 현상에 대한 체계적 연구

최근 연구에 따르면, AI 언어 모델의 성능을 평가하는 벤치마크의 약 절반이 '포화(Saturation)' 상태에 도달하여 모델 간의 우열을 가리기 어렵고 장기적 가치가 떨어지는 것으로 나타났습니다. 특히 포화 현상을 방지하는 핵심 요소는 테스트 데이터의 공개 여부가 아니라 전문가의 철저한 큐레이션과 설계 방식인 것으로 밝혀졌습니다. 이는 향후 모델 평가 방식이 더 지속 가능하고 견고한 방향으로 재설계되어야 함을 시사하는 중요한 연구입니다.

인공지능 벤치마크 언어모델
HN
Hacker News • 56일 전
IMP 7

1975년산 8비트 6502 프로세서에서 구동하는 자회귀 언어모델

현대의 머신러닝 기술을 1975년형 8비트 6502 프로세서(RAM 32KB)에 탑재하여 자회귀 언어모델을 구동시킨 흥미로운 프로젝트입니다. 가중치 양자화에 CPU 연산에 유리한 BitNet 구조를 적용하고, 코드를 극한으로 최적화하여 구형 하드웨어에서도 AI 모델의 텍스트 생성이 가능함을 증명했습니다. 제한된 하드웨어 환경에서 모델을 경량화하고 최적화하는 실용적인 접근법을 보여줍니다.

언어모델 경량화 비트넷
TD
The Decoder • 57일 전
IMP 8

언어 모델은 불가능, 세계 모델이 과학 혁명을 이끌 것이다

구글 딥마인드의 톰 자하비(Tom Zahavy)는 언어 모델이 귀납과 연역은 잘 수행하지만, 완전히 새로운 가설을 만들어내는 '가추(Abduction)' 능력이 부족하다고 지적합니다. 특히 그는 수학적 계산이 아닌 신체적 감각을 기반으로 한 사고의 도약이 필요하며, 이는 언어 모델의 한계를 넘어 '세계 모델(World models)'만이 달성할 수 있다고 주장합니다.

인공지능 언어모델 세계모델
HN
Hacker News • 81일 전
IMP 8

Pulpie: 웹 데이터 정화를 위한 효율적 오픈소스 AI 모델

Feyn Labs가 HTML 페이지에서 핵심 내용만 빠르고 저렴하게 추출하는 파레토 최적의 AI 모델군인 'Pulpie'를 오픈소스로 공개했습니다. 기존 최고 수준(SOTA) 모델인 Dripper와 비슷한 성능을 내면서도 크기는 1/3, 추론 비용은 1/20 수준으로, 10억 페이지 처리 비용을 약 2,890만 원에서 58억 원으로 대폭 절감할 수 있습니다. 깨끗한 데이터는 언어 모델의 사전 학습 및 추론 성능 향상에 핵심적인 역할을 하므로, 이 모델은 대규모 웹 데이터 처리에 있어 매우 중요한 돌파구가 될 것입니다.

데이터 정제 오픈소스 언어모델
MP
MarkTechPost • 87일 전
IMP 7

엔비디아, 확산 기반 언어모델 '네모트론 투타워' 공개

엔비디아가 기존 자기회귀(AR) 모델의 텍스트 생성 속도 한계를 극복하기 위해 오픈 웨이트 기반의 확산 언어 모델(Diffusion Language Model) '네모트론 투타워(Nemotron-Labs-TwoTower)'를 공개했습니다. 이 모델은 사전 학습된 자기회귀 백본을 기반으로 하여 텍스트 생성 시 발생하는 처리량(Throughput) 병목 문제를 해결하는 것을 목표로 하며, NVIDIA Nemotron Open Model License를 따릅니다. AI 실무자들에게 텍스트 생성 효율을 획기적으로 높일 수 있는 중요한 대안을 제시한다는 점에서 의미가 있습니다.

엔비디아 언어모델 오픈소스
HN
Hacker News • 94일 전
IMP 8

큐원 에이전트월드: 범용 에이전트를 위한 언어 세계 모델

알리바바 큐원(Qwen) 연구팀이 에이전트의 추론 및 계획 능력을 향상시키기 위해 7개 주요 도메인의 환경을 시뮬레이션할 수 있는 새로운 언어 기반 세계 모델인 '큐원 에이전트월드(Qwen-AgentWorld)'를 공개했습니다. 이 모델은 기존 최고 수준의 모델들을 능가하는 성능을 보여주며, 방대한 실제 상호작용 데이터와 강화학습(RL)을 통해 탄생했습니다. 이는 단순히 성능이 좋은 모델을 넘어, 가상 환경 시뮬레이터 및 사전 학습 도구로 활용되어 범용 인공지능 에이전트의 학습 효율과 성공률을 획기적으로 끌어올린다는 점에서 중요합니다.

언어모델 에이전트 강화학습
MP
MarkTechPost • 98일 전
IMP 7

VibeThinker-3B 공개: 소형 모델로 대형 AI 성능 맞춤

단 30억(3B) 개의 매개변수를 가진 소형 추론 모델인 VibeThinker-3B가 공개되었습니다. 이 모델은 효율적인 포스트 트레이닝(Post-training) 파이프라인을 적용하여 DeepSeek V3.2 및 Kimi K2.5 같은 거대 AI 모델들과 필적하는 검증된 벤치마크 성능을 기록했습니다. 적은 컴퓨팅 자원으로도 뛰어난 성능을 낼 수 있음을 증명했다는 점에서 AI 실무자들에게 매우 중요한 의미를 갖습니다.

오픈소스 언어모델 AI추론
MP
MarkTechPost • 129일 전
IMP 8

엔비디아, Qwen3-8B 대비 6배 빠른 트리모드 언어모델 공개

엔비디아가 기존 오픈소스 모델인 Qwen3-8B보다 한 번의 연산(Forward pass)당 6배 많은 토큰을 처리하는 새로운 트리모드 언어 모델 'Nemotron-Labs-Diffusion'을 발표했습니다. 이 모델은 텍스트, 코드, 이미지 생성 등 다양한 생성(AI) 작업을 단일 모델에서 처리할 수 있도록 설계되었습니다. 이는 AI 모델의 연산 효율성을 획기적으로 끌어올리며, 실시간 처리와 대규모 배포가 필요한 실무 환경에서 매우 중요한 기술적 진전으로 평가됩니다.

엔비디아 언어모델 오픈소스
LL
r/LocalLLaMA • 140일 전
IMP 7

AI2, 문서 수준 라우팅 기반 MoE 'EMO' 공개

Allen Institute for AI(AI2)가 1T 토큰으로 학습된 새로운 MoE(Mixture of Experts) 모델인 EMO(14B 전체 파라미터 중 1B 활성화)를 공개했습니다. 이 모델의 가장 큰 특징은 기존의 표면적 패턴이 아닌 건강, 뉴스 등 특정 도메인을 기준으로 문서 수준 라우팅(document-level routing)을 수행한다는 점입니다. 라우팅 방식의 이러한 혁신은 전문가 모델의 할당을 훨씬 더 정교하게 만들어 줍니다.

AI2 MoE 오픈소스
SG
r/singularity • 149일 전
IMP 7

미스트랄 3.5 미디움: 안정성을 강조한 유럽 오픈소스 모델

유럽의 AI 기업 미스트랄(Mistral)이 높은 신뢰성과 안정성을 핵심 경쟁력으로 내세운 새로운 오픈소스 언어 모델 '미스트랄 3.5 미디움(Mistral Medium 3.5)'을 공개했습니다. 이 모델은 실무적인 엔터프라이즈 환경에서의 오류 감소 및 일관된 성능 확보에 초점을 맞추고 있어, 상업적 서비스를 운영하는 개발자들에게 중요한 대안으로 평가받고 있습니다.

미스트랄 오픈소스 언어모델
LL
r/LocalLLaMA • 149일 전
IMP 7

IBM, 기업용 모델 '그라나이트 4.1' 3B/8B/30B 공개

IBM이 실제 기업 환경에 즉시 도입할 수 있는 '그라나이트 4.1(Granite 4.1)' 모델 컬렉션을 발표했습니다. 이번 릴리스는 30B 이하의 가벼운 크기임에도 불구하고 명령어 준수 및 도구 호출(Tool calling) 능력에서 기존 32B 모델을 뛰어넘는 비용 효율성을 제공하는 것이 가장 큰 특징입니다. 또한 512K 토큰의 긴 문맥 처리, 최고 수준의 음성 인식, 그리고 엄격한 유해 탐지 기능까지 지원하여 기업용 AI 워크플로우 최적화에 유리합니다.

오픈소스 IBM 언어모델
LL
r/LocalLLaMA • 149일 전
IMP 7

허깅페이스에 미스트랄 3.5 공개

프랑스 AI 스타트업 미스트랄(Mistral AI)의 최신 대규모 언어 모델(LLM)인 '미스트랄 미디움 3.5(Mistral Medium 3.5)'의 시스템 프롬프트와 구동 방식이 허깅페이스(Hugging Face)를 통해 공개되었습니다. 이 모델은 자체적인 웹 검색 기능은 없지만 도구(Tools)를 활용한 실시간 정보 검색과 추론(Reasoning) 기능을 수행할 수 있도록 설계되었습니다. 특히 자체 챗봇 '르 챗(Le Chat)'의 기반 모델로 활용되며, 날짜 계산 및 멀티모달(이미지 읽기) 처리 능력을 갖춘 점이 주요 특징입니다.

미스트랄 언어모델 오픈소스
TD
The Decoder • 154일 전
IMP 7

알리바바 Qwen3.6-27B, 더 큰 모델 능가하는 코딩 성능

알리바바가 270억 파라미터의 새로운 오픈소스 밀집(Dense) 언어 모델인 Qwen3.6-27B를 공개했습니다. 이 모델은 3,970억 파라미터의 거대한 이전 버전을 거의 모든 코딩 벤치마크에서 압도하며, 훨씬 가벼운 크기로도 뛰어난 성능을 발휘합니다. 개발자들은 복잡한 MoE 구조 없이도 강력한 코딩 및 멀티모달 추론 성능을 활용할 수 있게 되었습니다.

Qwen 오픈소스 코딩 벤치마크
HN
Hacker News • 177일 전
IMP 7

25개 생물종 mRNA 언어모델, 단 165달러에 학습

단백질 구조 예측부터 서열 설계, 코돈 최적화(Codon optimization)까지 아우르는 엔드투엔드 AI 파이프라인이 구축되었습니다. 코돈 수준의 언어 모델링 비교 결과 'CodonRoBERTa-large-v2'가 4.10의 퍼플렉시티와 0.40의 스피어만 CAI 상관관계를 기록하며 기존 모델을 크게 상회하는 성능을 입증했습니다. 25개 생물종을 대상으로 단 55 GPU시간만에 4개의 실 서비스용 모델을 학습하여, 타 오픈소스에서 제공하지 않는 종 조건부(species-conditioned) 시스템을 완성했다는 점이 핵심입니다.

생물정보학 mRNA 언어모델