AI 생성 메뉴판의 '똑같음' 문제
레스토랑과 카페 메뉴에 생성형 AI 일러스트가 확산되면서 모든 이미지가 지나치게 매끄럽고 대동소이한 미학을 보이는 문제가 나타나고 있다. 이는 AI 모델이 유사한 스타일의 대량 데이터로 학습되면서 ' convergence(수렴)' 현상을 일으키기 때문이며, AI 생성물이 다시 학습 데이터로 유입되면 모델 붕괴(model collapse) 위험도 커진다.
처음 이런 일을 겪으면 자신이 미쳐버린 것 같다. 카페에 들어가 다양한 베이글 샌드위치가 그려진 메뉴를 보는데, 각 일러스트가 섬뜩할 만큼 완벽하고 정확히 대칭이며 이상하게 매끄러워 뭔가 잘못됐다는 본능적인 감각이 든다. 편집증이라고 생각할 수 있지만, 정신이 나간 것이 아니다. 생성형 AI 메뉴가 음식점 업계에 상륙한 것이다. 좁은 범위의 '보기 좋은' 미학으로 학습된 모델 때문인데, 이유를 설명할 수 없어도 뭔가 어색하게 느껴진다. 때로는 치즈가 너무 bubbling하고 녹아 있어 점심이라기보다 전위예술처럼 보이는 부리토처럼 명백히 가짜인 경우도 있다. 하지만 더 자주는 너무 평범해 보여서 자세히 다시 봐야 뭔가 잘못됐다는 것을 알아차린다.
"거대언어모델(LLM)과 확산 모델(diffusion model) — ChatGPT나 Midjourney 같은 챗봇과 이미지 생성기를 가능하게 하는 AI 모델들 — 은 방대한 양의 데이터로 학습됩니다. 모델은 데이터셋에서 패턴을 식별해 '버거 레스토랑 메뉴판을 만들어줘' 같은 요청에 대해 사용자가 원하는 것을 예측합니다."
"이런 것들의 상당수가 2015년 칠리스(Chili's) 메뉴판처럼 보이는데, 이유가 있습니다. 그게 모델이 기능을 끌어낸 데이터의 집합이었으니까요."
새로운 학습 데이터는 AI 모델을 만드는 기업들에게 매우 귀중하다 — 아마존은 희귀 도서를 조달해 스캔해 학습 데이터에 추가한 뒤 파기한 것으로 밝혀지기도 했다. 이해하기 어려울 만큼 거대한 데이터셋에 AI 생성 콘텐츠가 일부 스며드는 것은 불가피하다. 하지만 AI 모델이 자신이 생성한 AI 콘텐츠를 너무 많이 학습하면 모델 붕괴(model collapse) 위험이 있다.
"모델 붕괴는 거의 광우병 같은 것입니다. 한 모델의 출력을 다시 그 모델에 먹이면 결국 근친교배가 심해져 전체가 붕괴합니다. 여기서 우리가 보는 것은 수렴(convergence)인데, 반드시 모델 붕괴는 아닙니다."
수렴은 좀 덜 극단적이어서, AI 출력을 완전히 쓸모없게 만들지는 않으면서 품질을 저하시킨다. 패스트푸드 레스토랑 메뉴 생성을 요청하면 모델은 웬디스, 버거킹, 맥도날드 등 인기 체인의 메뉴를 참고할 것이다. 이 메뉴들은 이미 비슷한 스타일을 공유하므로 AI 생성 결과물도 같은 스타일을 모방하고, 이 메뉴가 다시 학습 데이터로 돌아가면 그 스타일이 더욱 강화된다.
하지만 음식 메뉴와 광고는 실제보다 항상 더 좋아 보이기 마련이다. 맥도날드 광고의 빅맥처럼 샌드위치의 각 층이 소품 디자이너가 최대한 먹음직스럽게 배열한 것처럼 말이다. 이 효과는 AI 출력에서 더 두드러질 수 있다.
"데이터셋은 '보기 좋음', 즉 불쾌감을 주지 않는 쪽으로 최적화되어 있고, 그래서 획일화로 이어지는 측면이 있습니다. AI는 이미지와 언어 모두에서 '가장자리를 깎아내는' 것으로 알려져 있죠."
더 작은 규모에서는, AI 이미지 생성기로 메뉴를 만들고 편집을 가할 때 이런 이미지의 매끄러움이 나타나는 것 같다. X에서 Labtec이라는 사용자는 메뉴를 만들 때 어떤 일이 벌어지는지 보여줬다.