메뉴

#파인튜닝

HN
Hacker News 1일 전
IMP 9

90억 파라미터 오픈소스 모델, 강화학습 파인튜닝으로 최첨단 AI 모델 제압

90억(9B) 개의 매개변수를 가진 오픈소스 모델을 강화학습(RL)으로 미세조정(Fine-tuning) 하자, 단 500달러의 비용으로도 최첨단 상용 AI 모델들을 특정 업무에서 능가하는 성능을 보여주었습니다. 이 성공의 핵심은 단순한 모델 도입이 아니라 기존 워크플로우를 재설계하고, 회사의 고유한 비즈니스 맥락(Context)을 주입하는 전략적 접근에 있습니다. 이 글은 높은 AI 투자 수익률(ROI)을 달성하는 선도 기업들이 오픈소스 모델의 강화학습 파인튜닝에 주목하는 이유를 분석합니다.

강화학습 파인튜닝 오픈소스 모델
MP
MarkTechPost 7일 전
IMP 8

주요 LLM 파인튜닝 프레임워크 4종 비교 분석

현재 오픈소스 LLM 파인튜닝 생태계는 Unsloth, Axolotl, TRL, LLaMA-Factory 등 4대 프레임워크가 주도하고 있습니다. 이들은 PyTorch와 허깅페이스(Hugging Face)라는 동일한 기반 기술을 활용하지만, 최적화 속도, VRAM 효율성, 다중 GPU(Multi-GPU) 지원 등 각자 다른 엔지니어링 목표와 전략에 집중하며 차별화를 이루고 있습니다.

파인튜닝 LLM 오픈소스
MP
MarkTechPost 10일 전
IMP 7

엔비디아 NeMo로 코랩에서 효율적으로 튜닝하는 법

이 튜토리얼은 구글 코랩(Google Colab)의 단일 GPU 환경에서 엔비디아(NVIDIA)의 NeMo AutoModel과 LoRA 기법을 활용해 Qwen3-0.6B 모델을 미세 조정(fine-tuning)하는 전체 과정을 다룹니다. 복잡한 환경 설정 없이 누구나 쉽게 대형 언어 모델을 학습시키고 최적화할 수 있는 실질적인 단계별 가이드를 제공하여 개발자에게 매우 유용합니다.

파인튜닝 엔비디아_네모 로라
HN
Hacker News 13일 전
IMP 8

오픈 웨이트 모델 '잉클링(Inkling)' 공개

새로운 오픈 웨이트(Open-Weights) 기반 파운데이션 모델인 '잉클링(Inkling)'이 공개되었습니다. 이 모델은 총 975B(활성 41B) 매개변수와 최대 1M 토큰의 컨텍스트를 지원하며, 특히 텍스트, 이미지, 오디오를 아우르는 멀티모달推理 및 에이전트 코딩에 강점을 보입니다. 개발자들은 Tinker 플랫폼을 통해 이 모델을 손쉽게 파인튜닝(Fine-tuning)하여 다양한 실제 작업 환경에 맞춤형으로 활용할 수 있다는 점에서 의미가 큽니다.

오픈소스 파인튜닝 멀티모달
HN
Hacker News 14일 전
IMP 9

AI를 강화학습시켜 AI를 강화학습시키는 에이전트 개발 (약 1,300달러)

개발자가 강화학습(RL)을 통해 다른 AI 모델을 효과적으로 학습시키는 방법을 스스로 터득하는 메타 에이전트를 구축했습니다. 이 에이전트는 주어진 과제에 맞춰 데이터셋과 보상 코드 등을 작성해 실제 GPU 환경에서 소형 모델을 학습시키며, 모델의 성능이 오를수록 에이전트 자체도 강화학습으로 발전합니다. 코드와 모델 가중치 등 모든 과정이 오픈소스로 공개되어, 자가 개선(self-improving)이 가능한 AI 시스템의 실질적 구현 및 저비용 검증이라는 점에서 매우 중요합니다.

강화학습 오픈소스 메타러닝
MP
MarkTechPost 17일 전
IMP 7

미라 무라티 사고기계연구소, 맞춤형 가중치 기반 인간 중심 AI 주장

미라 무라티(Mira Murati)가 이끄는 사고기계연구소(Thinking Machines Lab)는 인간의 참여, 모델 소유권, 탈중앙화된 정렬을 핵심 기술 과제로 다루는 에세이를 발표했습니다. 특히 팀이 직접 LoRA 파인튜닝을 통해 모델 가중치(Model Weights)를 훈련하고 소유할 수 있는 기술적 방안을 제시하며, 사용자가 통제권을 갖는 '인간 중심 AI'의 구현 가능성을 제시했다는 점에서 중요합니다.

인간 중심 AI 모델 가중치 파인튜닝
MP
MarkTechPost 23일 전
IMP 7

튜닉스 GRPO와 LoRA로 젬마-3 수학 추론 훈련하기

구글의 오픈소스 모델인 젬마-3(Gemma-3)에 GRPO(그룹 상대 정책 최적화) 훈련 워크플로우를 적용하여 GSM8K 수학 문제를 단계적으로 풀도록 훈련하는 방법을 다룬 실용적인 가이드입니다. LoRA 어댑터를 결합해 훈련을 가볍게 유지하면서, 모델이 정해진 형식을 따르고 정답을 맞히도록 보상 함수를 설계하는 것이 핵심입니다. AI 모델의 수학적 구조화 추론 및 강화학습 기반 미세조정 파인튜닝 방법을 이해하는 데 중요한 레퍼런스가 될 수 있습니다.

파인튜닝 강화학습 젬마3
HN
Hacker News 36일 전
IMP 9

VibeThinker-3B, 새로운 학습법으로 대형 모델 능가

파라미터 30억(3B) 개의 소형 언어 모델인 VibeThinker-3B가 혁신적인 사후 학습 파이프라인을 통해 최신 대형 모델들을 능가하는 추론 성능을 달성했습니다. 단계별 지도 미세조정(SFT), 다중 도메인 강화학습, 오프라인 자가 증류를 결합해 수학 및 코딩 벤치마크에서 DeepSeek V3.2 등 대형 모델들과 동등하거나 더 뛰어난 결과를 보여주며, 작은 모델도 최적화된 학습법을 통해 최고 수준의 성능을 낼 수 있음을 증명했습니다.

소형언어모델(slm) 추론(reasioning) 강화학습(rl)
HN
Hacker News 37일 전
IMP 6

Qwen 3 0.6B 모델 파인튜닝으로 질문 분류하기

저자는 가사 관련 챗봇의 검색 정확도(RAG)를 높이기 위해 6억 개(0.6B)의 매개변수를 가진 초소형 로컬 LLM인 Qwen 3:0.6B를 파인튜닝하여 질문을 카테고리별로 분류하는 실험을 진행했습니다. 미세조정 전 원본 모델의 정답률은 10%에 불과했으나, Unsloth 프레임워크와 약 850개의 데이터를 활용해 학습을 진행하여 신뢰할 수 있는 분류기를 구축할 수 있었음을 보여줍니다.

로컬 LLM 파인튜닝 RAG
MP
MarkTechPost 39일 전
IMP 7

VibeThinker-3B 공개: 소형 모델로 대형 AI 성능 맞춤

단 30억(3B) 개의 매개변수를 가진 소형 추론 모델인 VibeThinker-3B가 공개되었습니다. 이 모델은 효율적인 포스트 트레이닝(Post-training) 파이프라인을 적용하여 DeepSeek V3.2 및 Kimi K2.5 같은 거대 AI 모델들과 필적하는 검증된 벤치마크 성능을 기록했습니다. 적은 컴퓨팅 자원으로도 뛰어난 성능을 낼 수 있음을 증명했다는 점에서 AI 실무자들에게 매우 중요한 의미를 갖습니다.

오픈소스 언어모델 AI추론
HN
Hacker News 54일 전
IMP 7

1995년도 스타일로 글쓰는 LLM 파인튜닝

이 글은 90년대 소프트웨어 기술 문서의 문체를 모방하는 로컬 LLM을 파인튜닝하는 과정을 다룹니다. 저자는 마이크로소프트의 과거 매뉴얼 데이터를 활용해 스타일을 전달하는 실험을 진행하며, RAG 대신 파인튜닝을 선택한 이유와 저비용으로 로컬 환경에서 모델을 세밀하게 조정할 수 있는 방법을 설명합니다. 이는 실무자들에게 AI의 스타일 학습 가능성과 효율적인 데이터 활용법을 보여줍니다.

파인튜닝 로컬 LLM 스타일 전송
MP
MarkTechPost 60일 전
IMP 8

파이썬으로 170만 건 AI 에이전트 데이터셋 구축하기

에이전트 상호작용 기록(Trace) 170만 건을 포함한 역대 최대 규모의 오픈소스 데이터셋인 'AgentTrove'를 활용하는 파이썬 실전 튜토리얼을 소개합니다. 이 튜토리얼은 대용량 데이터를 전체 다운로드 없이 스트리밍하고, 성공적인 기록만 추출해 고품질 SFT(Supervised Fine-Tuning) 데이터셋으로 변환하는 방법을 다룹니다. AI 에이전트의 파인튜닝을 위한 대규모 학습 데이터를 효율적으로 구축하려는 실무자들에게 매우 유용한 가이드입니다.

데이터셋 에이전트 파인튜닝
LL
r/LocalLLaMA 63일 전
IMP 8

클라우드 AI, 커스텀 파인튜닝 기능 공개

클라우드(Claude) AI가 사용자가 직접 모델을 파인튜닝(Fine-tuning)할 수 있는 기능을 발표했습니다. 이를 통해 기업은 자사 데이터에 맞춰 AI를 최적화하고 성능을 극대화할 수 있게 되었습니다. 특히 API(응용 프로그래밍 인터페이스)를 통해 손쉽게 적용이 가능하여 실무적인 활용도가 매우 높습니다.

인공지능 클라우드 파인튜닝
OA
r/OpenAI 82일 전
IMP 8

OpenAI, 파인튜닝(Fine-tuning) 서비스 중단 발표

OpenAI가 파인튜닝 API 및 플랫폼 서비스를 단계적으로 중단한다고 발표했습니다. 기존 고객은 2027년 1월 6일까지만 새로운 학습을 진행할 수 있으며, 이후에는 파인튜닝된 모델의 추론(Inference)도 베이스 모델이 폐기될 때 함께 종료됩니다. 이로 인해 프롬프트와 RAG만으로는 한계가 있는 일관된 성격 구현을 위해 파인튜닝을 사용하던 개발자들이 비용 절감 조치에 반발하며 대안을 찾아 떠날 것으로 보입니다.

OpenAI 파인튜닝 API
TD
The Decoder 85일 전
IMP 7

아마존 세이지메이커, AI 에이전트 파인튜닝 지원

아마존 SageMaker AI에 자연어로 사용자의 요구를 파악해 모델 학습부터 배포까지 자동화하는 '에이전트 파인튜닝' 기능이 도입되었습니다. 개발자가 복잡한 과정 없이 텍스트로 사용 사례를 입력하면, 내장된 AI 에이전트가 데이터 준비, 학습, 코드 생성 등을 수행합니다. 라마, 큐원, 딥시크 등 주요 오픈소스 모델부터 아마존의 노바까지 폭넓게 지원하여 실무 개발자들의 진입 장벽과 작업 시간을 크게 줄여준다는 점에서 중요합니다.

AWS 세이지메이커 파인튜닝
MP
MarkTechPost 88일 전
IMP 8

SFT부터 DPO, GRPO까지: TRL을 활용한 LLM 후처리 튜토리얼

이 튜토리얼은 강력한 TRL 라이브러리 생태계를 활용하여 대형 언어 모델(LLM)을 후처리하는 전체 과정을 코드와 함께 안내합니다. 가벼운 베이스 모델을 시작으로 SFT, 보상 모델링(RM), DPO, GRPO 등 4가지 핵심 기법을 점진적으로 적용하며 모델의 정렬(alignment) 파이프라인을 구축하는 방법을 다룹니다. LoRA와 같은 효율적인 기법을 사용하여 구글 코랩(Colab) T4 GPU 같은 제한된 하드웨어 환경에서도 실습할 수 있도록 구성되어 있다는 점이 특징입니다.

대형언어모델 파인튜닝 강화학습
LL
r/LocalLLaMA 97일 전
IMP 7

큐웬3 TTS, 로컬 실시간 구동 가능한 최고의 오픈소스 모델

한국의 AI 독자를 위해 번역·요약한 결과, 이 프로젝트는 오픈소스 큐웬3 TTS(Qwen3 TTS) 모델을 활용해 로컬 환경에서 실시간 음성 합성 및 아바타 립싱크 파이프라인을 구현한 사례입니다. 스트리밍 안정화, llama.cpp를 통한 양자화 및 속도 최적화, CTC 기반 워드 레벨 정렬(자막·립싱크용), 그리고 맞춤형 음성 파인튜닝까지 성공적으로 수행하여, 기존 로봇 같던 TTS를 매우 표현력 있고 자연스러운 음성으로 개선했다는 점이 핵심입니다.

TTS 오픈소스 로컬-추론
MP
MarkTechPost 111일 전
IMP 7

ModelScope 실전 가이드: 검색부터 파인튜닝, 배포까지

ModelScope 허브를 활용하여 AI 모델을 검색, 다운로드, 파인튜닝 및 배포하는 방법을 다루는 실전 튜토리얼입니다. IMDB 데이터셋을 이용한 감성 분류기 미세조정 과정을 통해 자연어처리(NLP) 파이프라인을 직접 구축해 봅니다. 허깅페이스(Hugging Face)와의 호환성을 강조하며 연구부터 프로덕션 환경까지 아우르는 통합 워크플로우를 제공합니다.

ModelScope 파인튜닝 오픈소스 AI
LL
r/LocalLLaMA 112일 전
IMP 8

8GB VRAM으로 Gemma 4 로컬 파인튜닝 및 버그 수정 안내

Unsloth에서 무료 노트북을 통해 Gemma 4 E2B 및 E4B 모델을 파인튜닝할 수 있게 되었습니다. 단 8GB VRAM만으로도 로컬 환경에서 학습이 가능하며, 기존 대비 약 1.5배 빠르고 60% 적은 VRAM을 사용합니다. 또한 학습 시 Loss 폭주, 추론 오류 등 4가지 핵심 버그를 수정하여 안정적인 학습 및 추론 환경을 제공합니다.

Gemma-4 파인튜닝 오픈소스