아이는 AI보다 적은 데이터로 언어를 배운다—그 이유는 아직 미스터리
LLM은 인간 아이보다 최대 10만 배 많은 언어 데이터를 소비해야 유창한 언어 구사가 가능한데, 이 '데이터 효율성 격차'는 인지과학과 AI 연구 모두에 중요한 난제다. 인터넷 데이터가 2030년대에 고갈될 수 있다는 전망 속에서 아이의 학습 방식을 역설계해 데이터 효율적인 AI 모델을 만들려는 연구가 주목받고 있다.
LLM은 인간 아이보다 최대 10만 배 많은 언어 데이터를 소비해야 유창한 언어 구사가 가능한데, 이 '데이터 효율성 격차'는 인지과학과 AI 연구 모두에 중요한 난제다. 인터넷 데이터가 2030년대에 고갈될 수 있다는 전망 속에서 아이의 학습 방식을 역설계해 데이터 효율적인 AI 모델을 만들려는 연구가 주목받고 있다.
아마존은 자사 생성형 AI 모델 학습에 트위치 크리에이터들의 콘텐츠를 활용하며, 거부(opt-out)하지 않는 한 기본적으로 모든 콘텐츠를 사용합니다. 트위치 측은 사용자 반발을 예상하면서도 수동 거부 방식을 택해 크리에이터들의 강력한 비판에 직면했습니다. 크리에이터들은 채널 설정의 개인정보 보호 탭에서 이 AI 학습 옵션을 직접 꺼야만 자신의 영상과 음성 데이터가 무단으로 학습되는 것을 막을 수 있습니다.
크리에이터 플랫폼 Patreon이 클라우드플레어(Cloudflare)와 협력하여 크리에이터의 콘텐츠를 무단으로 긁어가는 AI 학습 봇을 직접적으로 차단하고 있습니다. 단순히 로봇.txt(robots.txt) 파일로 접근을 자제해달라고 요청하는 데 그치지 않고, 강력한 인프라 차원의 조치를 취함으로써 AI 기업들의 콘텐츠 무단 학습으로부터 크리에이터의 권리를 적극적으로 보호하려는 의도입니다.
구글이 검색 서비스를 통해 사용자의 이미지, 음성 등 다양한 데이터를 AI 모델 학습에 활용하는 새로운 정책을 기본적으로 적용(Opt-out 방식)합니다. 개인정보 침법 우려가 크며, 데이터가 AI 학습에 사용될 경우 계정에서 연결이 끊긴 채 최대 4년간 보관될 수 있어 즉각적인 수집 거부 설정이 필요합니다.
메타(Meta)가 사내 보안 문제로 인해 수집된 직원 데이터가 노출되자, AI 학습 목적의 직원 모니터링 프로그램(MCI)을 일시 중단했습니다. 이 프로그램은 마우스 움직임과 키 입력 등을 추적해 인간의 컴퓨터 사용 방식을 AI에게 학습시키려 했으나, 직원들의 강력한 프라이버시 침해 반발을 샀습니다. 결국 심각한 사내 데이터 노출 사고가 발생하면서 메타는 해당 프로그램의 운영을 전면 중단하고 조사에 나섰습니다.