HN
Hacker News • 33일 전
IMP 7
AI에게 코드로 그림 그리는 법을 가르치다
저자는 강화학습(RL)을 이용해 언어 모델이 p5.brush JavaScript 코드를 작성해 수채화 이미지를 생성하도록 훈련시켰습니다. 절대 점수 방식의 보상 함수가 모델을 정체시키자, 페어와이즈(pairwise) 판단과 수작업 평가된 참고 이미지 풀로 전환해 성능을 개선했습니다. 이 프로젝트는 검증 가능한 정답이 없는 창작·디자인 작업에 강화학습을 적용하는 방법을 탐구한다는 점에서 중요합니다.
강화학습 이미지 생성 GRPO