비트토렌트 방식으로 집에서 대형 언어 모델 돌리기
가정용 GPU나 구글 코랩 환경에서 비트토렌트(BigScience Petals) 방식으로 초대형 언어 모델을 구동할 수 있는 오픈소스 프로젝트입니다. 사용자들이 모델의 일부분씩을 분산하여 연산함으로써, 초고사양 하드웨어 없이도 Llama 3.1이나 Mixtral 등 거대 모델을 실행하고 파인튜닝할 수 있다는 점이 가장 큰 의의입니다.
Petals: 비트토렌트 방식으로 집에서 대형 언어 모델(LLM) 실행하기.
소비자용 그래픽카드(GPU)나 구글 코랩(Colab)을 사용하여 Llama 3.1(최대 405B), Mixtral(8x22B), Falcon(40B+), 또는 BLOOM(176B) 모델로 텍스트를 생성하고, 원하는 작업에 맞게 파인튜닝(fine-tuning)할 수 있습니다. 사용자는 모델의 일부분만 로드한 뒤, 나머지 부분들을 서빙하는 다른 사람들의 네트워크에 참여하는 방식입니다.
단일 배치 추론(Inference) 시 Llama 2(70B)의 경우 초당 최대 6토큰, Falcon(180B)의 경우 초당 최대 4토큰의 속도로 실행되며, 이는 챗봇 및 인터랙티브 애플리케이션을 구동하기에 충분한 속도입니다.
기존의 전형적인 LLM API를 넘어, 원하는 파인튜닝 및 샘플링(Sampling) 방식을 자유롭게 적용할 수 있습니다. 모델 내부에서 커스텀 경로를 실행하거나 숨겨진 상태(hidden states)를 확인할 수도 있습니다. API의 편리함과 함께 PyTorch 및 🤗 Transformers의 유연성을 모두 누릴 수 있습니다.
구독해 주셔서 감사합니다! 정말 흥미로운 업데이트가 있을 때만 이메일을 보내드립니다.
지금 코랩에서 사용해 보기 GitHub에서 문서 보기 현재 최고 기여자: 로딩 중... 앗, 네트워크 상태를 불러올 수 없습니다...
그 외 더 많은 기여자들 내 GPU 기여하기 Discord나 이메일을 통해 개발 현황 팔로우하기: 구독하기 몇 달에 한 번씩 업데이트를 보내드립니다. 스팸 없음. 제출 중... 주소 확인을 위한 이메일을 보냈습니다. 링크를 클릭하시면 구독이 완료됩니다!
추천/소개 출처: 이 프로젝트는 BigScience 연구 워크숍의 일환입니다.