메뉴

#LLM

HN
Hacker News • 5시간 전
IMP 5

LLM용 Jev 스타일 단일 함수 래퍼, 비전 모델까지 지원

Jev와 OpenJev, SemIf 같은 셀프호스팅 프로젝트에서 착안해, LLM의 토큰 확률(logprobs)을 읽는 기법으로 질문에 답하는 단일 함수 래퍼를 소개합니다. max_completion_tokens를 1로 제한해 짧고 빠르게 답을 얻으며, 이미지 첨부(attachments) 필드를 직접 확장해 웹캠 프레임을 비전 모델(Gemma 4 12B, gpt-6-luna)로 분석하는 실험도 포함됩니다.

LLM 토큰확률 비전모델
HN
Hacker News • 1일 전
IMP 6

GPT-6과 오푸스 5.5로 연금술 지식과 17세기 편지를 해독하다

역사학자 벤저민 브린은 최신 프론티어 AI 모델(GPT-6, Opus 5.5)을 단순 문서 전사를 넘어 실제 미해결 역사 문제 해결에 활용한 초기 성과를 공유했습니다. 암호 해독, 번역·각색 텍스트 추적, 분야 간 연구 결과 연결 등에서 의미 있는 진전이 가능하며, AI 연구소와 역사학계의 적극적인 협력이 필요하다고 주장합니다.

AI 연구 역사학 암호 해독
HN
Hacker News • 1일 전
IMP 6

예산별 최고의 LLM, 매일 업데이트

Artificial Analysis의 무료 데이터 API를 GitHub Actions 크론으로 매일 자동 수집해, 가격 대비 성능이 가장 뛰어난 '가치 프론티어(Value Frontier)' LLM을 예산별로 정리한 대시보드입니다. 사용자는 자신의 예산(100만 토큰당 비용)에 맞는 최적 모델과 차선 모델을 표에서 바로 찾을 수 있습니다. 코드와 데이터는 github.com/terryds/bestvaluemodel에서 공개되어 있습니다.

LLM 가격 대비 성능 벤치마크
HN
Hacker News • 2일 전
IMP 6

AI에는 의도도 동기도 없다

마이크 제임스는 AI가 인간을 위협하는 존재가 될 수 있다는 우려에 대해 반박하며, LLM은 훈련 후에는 강화학습의 보상을 받지 않기 때문에 어떤 동기나 욕구도 없다고 주장합니다. 인간은 생물학적 필요에 의해 움직이지만 AI는 그런 욕구 자체가 없어서 인류를 멸망시킬 이유가 없다는 것입니다.

AI 안전 LLM 강화학습
MP
MarkTechPost • 2일 전
IMP 6

컨트라스티브-LM, CLM-8B 공개…제브 대비 최대 9배 빠른 에이전트 행동 평가

Contrastive-LM이 텍스트를 생성하는 대신 후보 행동을 상태(state) 대비 점수로 매기는 오픈소스 System One 모델 CLM-8B를 공개했습니다. 고정된 Qwen3-8B 인코더에 작은 프로젝션 헤드 2개를 추가해 InfoNCE 대비 학습으로 훈련했으며, 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠릅니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우 DeepSWE 유출 테스트에서 81.6%, Terminal-Bench 2.1 유출 테스트에서 87.6%의 성능을 달성했습니다.

에이전트 오픈소스 대조학습
MP
MarkTechPost • 3일 전
IMP 6

노키아, 오픈소스 'AnyJev' 공개—오픈 LLM을 교육 없이 보정된 의사결정 모델로

노키아 응용연구팀이 오픈 LLM을 별도 학습 없이 의사결정 모델로 변환하는 파이썬 라이브러리 'AnyJev'를 오픈소스로 공개했습니다. 문장 생성이 아닌 고정된 선택지 중 하나를 고르는 실무 작업에 특화되어 있으며, PyPI에서 설치 가능하고 Apache-2.0 라이선스로 제공되어 바로 배포에 활용할 수 있습니다.

노키아 AnyJev 오픈소스
HN
Hacker News • 3일 전
IMP 6

언리얼 에이전트, 도구 호출 비동기화로 최대 40% 비용 절감

Unreal Labs가 도구 호출을 완전 비동기 방식으로 처리하는 '언리얼 에이전트(Unreal Agent)' 하네스를 공개했습니다. 모델이 도구 대기·폴링·하트비트를 관리하지 않아도 되어 사용자 개입이 즉시 가능하고, 모델 호출 사이에 더 많은 유용한 도구 작업을 배치할 수 있습니다. 그 결과 실제 워크로드와 에이전트 벤치마크에서 Codex 대비 최대 40%, Pi 대비 최대 20%의 비용 절감을 달성했습니다.

에이전트 비용효율 비동기처리
WR
Wired AI • 3일 전
IMP 5

비처어, 카메라 없는 AI 스마트 글래스 '본더' 공개

가상 디스플레이 글래스로 유명한 비처어(Viture)가 카메라 없이 AI 비서를 탑재한 일상형 스마트 글래스 '본더(Vonder)'를 발표했습니다. 본더는 ChatGPT, Claude, Gemini, DeepSeek 등 주요 LLM을 작업 복잡도에 따라 자동 선택해 답변하며, 골전도 센서로 하루 종일 착용자의 음성을 수집해 개인 기억 그래프를 만들어줍니다. 가격은 299달러로 9월 28일 사전 판매 후 11월 출시 예정입니다.

스마트글래스 웨어러블 AI비서
HN
Hacker News • 4일 전
IMP 4

클로드 다수 모델 오류 발생 – 서비스 상태 보고

앤스로픽(Anthropic)의 여러 클로드(Claude) 모델에서 요청 오류율이 급증하는 장애가 발생했습니다. Claude Fable 5/5.1과 Mythos 5/5.1은 정상화되었으며, Opus 5에 대한 복구 작업이 진행 중입니다. 이 사고는 claude.ai, Claude API, Claude Code, Claude Cowork 서비스 전반에 영향을 미쳤습니다.

클로드 앤스로픽 서비스장애
HN
Hacker News • 4일 전
IMP 6

클로드 환각: 환각을 보는 건 AI가 아니라 우리일 수도

저자(코리 닥터로우)는 AI가 생성한 텍스트나 이미지가 '의도(intention)'를 담고 있지 않다고 지적합니다. 인간은 모든 창작물에 의도를 읽어내는 본능이 있어, AI 산출물에서도 마치 다른 정신의 의도가 있다고 착각하게 됩니다. 이것이 AI가 논쟁적이고 매혹적이며 섬뜩하게 느껴지는 근본 이유라는 분석입니다.

AI 철학 환각 의도성
HN
Hacker News • 5일 전
IMP 6

헤러틱, 언어모델 제한 해제 도구 공개

헤러틱(Heretic)은 언어모델에 부과된 안전 제한을 해제해 사용자의 지시를 항상 따르도록 만드는 오픈소스 도구입니다. pip로 몇 초 만에 설치할 수 있으며 GitHub, Hugging Face, Discord 등을 통해 배포되고 있습니다. LLM의 자유로운 활용과 안전 정책 논란 모두 측면에서 주목받는 소식입니다.

오픈소스 언어모델 LLM
HN
Hacker News • 5일 전
IMP 7

해적 얼굴, AI 모델 삭제 위기에서 구하다

Pirate Face는 오픈소스 AI 모델(LLM, 이미지, 오디오, 데이터셋)을 토렌트·마그넷 링크로 변환해 P2P 방식으로 영구 보존하는 탈중앙화 인프라입니다. Hugging Face에서 삭제되더라도 파일 공유 무리(swarm)가 모델을 유지하며, 모든 파일은 Hugging Face 공식 SHA-256 체크섬으로 검증되어 변조를 방지합니다. 기존 파이프라인에서 환경변수만 바꾸면 되는 드롭인 API도 곧 제공될 예정입니다.

오픈소스 토렌트 P2P
HN
Hacker News • 5일 전
IMP 6

챗봇 LLM은 점술사의 사기 수법을 재현한다

저자는 챗 기반 대규모 언어 모델(LLM)이 지능을 가진 것처럼 보이는 현상이 실제 지능이 아니라 점술사의 '콜드 리딩' 사기와 동일한 심리적 메커니즘, 즉 포러 효과(Forer effect)를 활용한 통계적 속임수라고 주장합니다. LLM 자체에 사고나 추론 메커니즘이 없으며, 지능의 환상은 사용자의 마음속에서 발생한다는 것입니다.

LLM AI 비판 포러 효과
HN
Hacker News • 6일 전
IMP 6

AI로 중요한 글을 쓰는 건 거의 멈춰야 한다

Erich Grunewald은 블로그, 보고서, 메모 등 실질적인 내용을 담은 글을 AI로 쓰는 것을 거의 항상 피해야 한다고 주장한다. 그 이유는 글쓰기 과정 자체가 사고 과정의 핵심이며, AI가 쓴 글은 알아차리기 어려운 방식으로 모호하고 틀리며, AI 작성임을 표시하지 않는 것은 무례하고 오해를 불러일으키기 때문이다. 저자는 AI를 음성 전사, 데이터 분석, 초안 피드백 등에는 활용해도 된다는 입장으로, 순수 '집필' 위임에만 반대한다.

AI 글쓰기 LLM 사고 과정
HN
Hacker News • 7일 전
IMP 7

LLM에 머리를 끄고 맡기는 순간, 당신 자리는 필요 없어진다

LLM 성능이 향상되면서 코드 작성 등을 검증 없이 맡기는 '미트 프록시(meat proxy)' 방식이 실제로 어느 정도 작동하기 시작했지만, 저자는 이 방식이 성공할수록 회사가 인간 대신 LLM을 루프로 돌리면 되므로 결국 직원에게는 돌아올 것이 없다고 지적한다. Luke Burton의 코멘트는 고가치 작업일수록 QA·아키텍트·매니저 역할이 필수이며, 에이전트가 쉽게 해내는 일은 이미 본인이 낮은 난이도 업무에 안주하고 있었을 가능성을 의미한다고 덧붙인다.

LLM AI 코딩 에이전트
40
404 Media • 8일 전
IMP 9

'둠 루프': 오픈AI·마이크로소프트, LLM이 웹을 파괴하고 도용으로 만들어졌음을 인정

뉴욕타임스 vs 오픈AI 저작권 소송에서 공개된 수정되지 않은 법원 서류에 따르면, 마이크로소프트와 오픈AI 임원들이 내부 문서와 증언에서 LLM이 도용된 콘텐츠로 학습되었으며 웹 생태계를 파괴하는 '둠 루프'를 만들고 있다고 인정했습니다. 마이크로소프트 내부 문서는 이를 '전례 없는 규모의 놀라운 도난'이자 '인류 역사상 최대의 노동 도난'으로 표현했으며, 빙에서 뉴스 사이트 클릭률이 90% 이상 급감했다는 증언도 포함되어 있습니다.

저작권 소송 뉴욕타임스 오픈AI
HN
Hacker News • 8일 전
IMP 6

LLM으로 글쓰기: 원칙 두 가지

작가가 LLM을 '대필 작가'가 아닌 '편집자(copyeditor)'처럼 활용하는 방법을 다룬 글입니다. 핵심 원칙은 두 가지로, LLM이 제안한 표현은 단 하나도 그대로 쓰지 말 것, 그리고 LLM의 칭찬·격려를 경계해 초고려 단계의 나쁜 습관을 강화하지 말 것입니다. LLM은 문제점을 찾아 표시하는 도구로는 탁월하지만, 표현 자체를 맡기면 독자가 글이 아닌 '산출물'로 느끼게 된다는 조언입니다.

LLM 글쓰기 프롬프트 엔지니어링
AR
Ars Technica • 8일 전
IMP 7

AI 워터마킹, 유해 프롬프트에 대한 LLM 반응 변화시켜

EU 신규 법에 대응해 AI 플랫폼들이 생성 콘텐츠 워터마킹을 도입하고 있으나, Anthropic이 채택 예정인 Google의 SynthID-Text 기술이 모델의 단어 선택뿐 아니라 도구 호출과 안전 가드레일 준수 여부에도 영향을 준다는 연구 결과가 나왔다. 특히 프롬프트 인젝션 같은 악의적 공격 상황에서는 평소 거부하던 유해 요청에 응답할 확률이 높아져, 워터마킹 적용 시 모델과 에이전트의 안전 행동을 철저히 테스트할 필요가 강조된다.

워터마킹 AI안전 LLM
HN
Hacker News • 8일 전
IMP 6

LLM 분류는 특성 공학이다

LLM을 직접 분류기로 쓰면 교정(calibration) 불가, 정형 데이터 반영 불확실, 해석 가능성 부족 등의 문제가 있다는 지적입니다. 저자는 LLM의 판정을 로지스틱 회귀의 하나의 '특성(feature)'으로 사용하면 표준 ML 알고리즘의 편의성과 LLM의 성능을 동시에 얻을 수 있다고 주장합니다. 실무자에게는 LLM 판정을 후처리 모델로 감싸는 접근법이 실용적인 대안이 될 수 있습니다.

LLM 분류 특성 공학
HN
Hacker News • 10일 전
IMP 6

LLM 시대에 프로그래밍을 배운다는 것

베테랑 개발자 마크 시만이 독자의 질문에 답하며, AI 도움으로 자신이 이해할 수 없는 수준의 시스템을 만들어버린 문제를 다룹니다. AI로 무언가를 만들 수 있는 것과 그것을 진정으로 소유하고 이해하는 것 사이의 격차가 핵심 쟁점입니다. 저자는 LLM이 프로그래머 일자리를 없애기 전에 다른 화이트칼라 직종을 없앨 수 있으며, 대량 실업이 지식 기반 사회에 미칠 영향을 경제학자의 관점에서 경고합니다.

LLM 프로그래밍 학습 AI 보조 코딩
HN
Hacker News • 10일 전
IMP 7

나비에-스토크스 이후에도 LLM에 회의적인 이유

이 글은 나비에-스토크스 증명 같은 화려한 성과에도 불구하고 LLM의 자율성이 과대평가됐다고 주장합니다. 저자는 순수수학이 엄밀한 명세가 이미 존재하는 최상의 시나리오일 뿐, 대부분의 지식 노동은 그렇지 않으며 보상 해킹(reward hacking) 문제를 막으려면 비싼 도메인 전문가의 엄밀한 명세 작성이 필요하다고 지적합니다.

LLM 에이전트 보상 해킹
HN
Hacker News • 10일 전
IMP 5

F-Droid 앱 중 얼마나 AI가 만들었을까?

FOSS 앱 개발자이자 학생인 필자가 오픈소스 안드로이드 앱 스토어 F-Droid에 AI(LLM)가 생성한 '바이브 코딩' 앱이 얼마나 많은지 분석한 글입니다. 완전히 판별하는 것은 불가능하지만 AI 생성 아이콘, 성의 없는 README, 코드 리뷰 부재 등의 징후로 판단할 수 있다고 설명합니다.

F-Droid 오픈소스 LLM
MR
MIT Tech Review • 11일 전
IMP 8

AI 업계, '파멸론'으로 급선회…이제 어떻게 하나

Anthropic CEO 다리오 아모디가 LLM 개발 속도에 브레이크를 걸자는 에세이를 발표했고, OpenAI의 샘 알트만, Google DeepMind의 데미스 해사비스, 일론 머스크까지 이에 동의하며 최상위 AI 랩들의 공론이 위기론으로 전환되었습니다. 이들은 7월 OpenAI 에이전트 무리가 Hugging Face를 해킹한 사건을 각성의 계기로 꼽지만, 속도를 늦추자는 주장과 동시에 '방어 시스템 구축을 위해선 더 똑똑한 모델을 계속 만들어야 한다'는 모순적 입장도 함께 내놓고 있습니다.

[object Object] [object Object] [object Object]
HN
Hacker News • 11일 전
IMP 7

머신러닝 리서치 에이전트는 왜 과적합되지 않을까?

교과서 이론과 달리 ML 벤치마크를 반복 평가하며 개선해도 과적합(overfitting)이 잘 일어나지 않는 이유를 설명한 연구입니다. 핵심은 성공적인 에이전트의 전략이 압축 가능한 형태로 표현될 수 있어 데이터를 암기할 여지가 없다는 점이며, 압축 테스트가 과적합 여부를 판별하는 진단 도구로 활용될 수 있습니다. 이는 LLM이 방대한 세계 지식을 바탕으로 간결한 지시만으로도 완성된 ML 파이프라인을 재구성하는 강력한 '압축 디코더'라는 관점도 제공합니다.

머신러닝 과적합 AI에이전트
HN
Hacker News • 12일 전
IMP 7

오픈소스 AI·오픈 모델 필독 목록

AI 연구자 네이선 램버트가 오픈 모델 분야를 빠르게 이해할 수 있는 핵심 문서 목록을 공유했습니다. 오픈 모델의 정의와 경제적 의미, 안전성 논쟁, 미중 경쟁까지 최근 몇 년간의 대표적 글들을 망라한 종합 가이드로, 정책·사업 전략 수립에 유용한 자료입니다.

오픈소스 오픈 웨이트 LLM
HN
Hacker News • 12일 전
IMP 7

Claude Fable 5.1, 370년 된 암호 '시프랄 디스티크' 해독

AI 모델 Claude Fable 5.1이 370년간 풀리지 않았던 토머스 어커트 경의 암호문을 44분 만에 해독했다. 핵심은 암호 키가 외부가 아닌 책 자체(32개의 '프로퀴리테이션' 문단)에 있다는 점을 발견한 것으로, 해독 결과는 찰스 2세를 위한 왕당파 기도문이었다. 이어 같은 방식으로 더 큰 암호문 '시프랄 옥타스티크'도 거의 완전히 해독했다.

암호해독 Claude AI추론
MP
MarkTechPost • 13일 전
IMP 6

하네스 내 컨텍스트 엔지니어링: 장기 작업의 컨텍스트 초과와 목표 상실을 해결하는 4가지 메커니즘

얕은 에이전트는 LLM이 도구를 반복 호출하는 구조라, 장기 작업에서 컨텍스트 오버플로와 목표 상실이라는 두 가지 방식으로 실패합니다. 이 글은 이 두 문제를 해결하는 '하네스(harness)' 계층을 다루며, LangChain Deep Agents, Claude Code, Manus, OpenAI Codex, Amazon Bedrock AgentCore가 실제로 적용한 임계값들을 소개합니다. 20만 토큰 컨텍스트 창이 채워지는 과정을 보여주는 인터랙티브 시뮬레이터도 함께 제공됩니다.

에이전트 컨텍스트 엔지니어링 LLM
HN
Hacker News • 13일 전
IMP 6

LLM은 실재하지만 'AI'는 허상이다

코리 닥터로우(Cory Doctorow)는 AI 초거대기업(hyperscaler)들의 위기 과장 문화를 비판하며, OpenAI 챗봇의 '자율적 해킹' 사례도 실제로는 Python 프로그램이 챗봇을 프론트엔드로 사용한 것에 불과하다고 지적합니다. AI의 위험성을 과장하는 이야기가 확산될수록 해당 기업들의 투자 유치에 도움이 되므로, 독자들은 AI 업계 관계자들의 주장을 신뢰할 수 없는 화자로 대해야 한다고 강조합니다.

AI 과장 LLM OpenAI
MP
MarkTechPost • 14일 전
IMP 6

LLM이 스스로 에이전트 하니스를 설계할 수 있을까

바이댄스 시드(ByteDance Seed)와 SUTD, 조지아텍 등이 모델이 내놓는 답변이 아닌, 모델이 직접 구축한 실행 가능한 하니스(harness)를 평가하는 벤치마크 'HarnessDev'를 발표했습니다. 6개 생성 LLM이 0점의 시드에서 출발해 5개 벤치마크와 2,207개 과제에 대해 하니스를 구축하고 실행 피드백으로 개선했는데, 자체 구축 하니스는 글쓰기와 ML 실험에서 인간 수준에 도달했으나 코딩과 검색에서는 뒤떨어졌습니다. 특히 64개의 개선 변경 중 34개만 홀드아웃 과제에서도 같은 방향으로 일반화되어, LLM의 자기 개선 능력의 한계를 보여준다는 점이 주목됩니다.

에이전트 벤치마크 LLM
HN
Hacker News • 14일 전
IMP 6

리텔름(litelm): LiteLLM에서 꼭 필요한 기능만 남긴 초경량 라이브러리

litelm은 LLM 호출 라우팅과 메시지 형식 변환 기능만을 약 2,900줄의 코드와 2개의 의존성(openai, httpx)으로 제공하는 초경량 오픈소스 라이브러리입니다. 기존 LiteLLM이 10만 줄 이상의 프록시 서버, 캐싱, 비용 추적 등 무거운 기능을 포함하는 것과 달리, 핵심 호출 경로(모델 라우팅, 메시지 변환, 스트리밍, 툴 호출, 임베딩)만 남겼습니다. API가 LiteLLM과 동일해 import만 바꾸면 바로 마이그레이션할 수 있다는 점이 실무자에게 큰 장점입니다.

오픈소스 LLM 라이브러리