모든 언어를 위한 AI: 300개 언어, 70억 인구를 잇다
구글은 AI 번역 기술을 300개 이상 언어(전 세계 인구의 86%)로 확장하며, 단순 텍스트 번역을 넘어 감정·어조·속어, 코드 스위칭까지 이해하는 원어음 오디오 인텔리전스로 발전시키고 있습니다. Gemini 3.5 Live Translate와 Transcribe, 1,000개 언어 지원 이니셔티브를 통해 데이터가 부족한 언어에도 교차 언어 전이 학습 기법으로 접근성을 높이는 것이 핵심입니다.
모든 언어로, 모두를 위한 AI
2026년 9월 15일 | 제임스 매니카(James Manyika), Research, Labs, Technology & Society 부문 수석 부사장
AI 생성 요약: 구글은 AI를 활용해 수백 개 언어로 사람들이 소통할 수 있도록 돕고 있으며, 그중에는 그동안 기술에서 소외되었던 언어들도 포함됩니다. 단순히 텍스트를 번역하는 것을 넘어, 사람들이 실제 삶에서 사용하는 감정, 어조, 속어까지 AI가 이해하도록 훈련하고 있습니다. 또한 전 세계 지역 사회와 협력해 안정적인 인터넷이 없는 사람들까지도 도구를 사용할 수 있도록 하고 있습니다. 이를 통해 기술이 다양한 문화를 존중하고, 모든 사람이 자신의 방식대로 이해받을 수 있도록 돕습니다.
오늘날 우리의 기술과 제품은 전 세계 인구의 86%에 해당하는 70억 명 이상이 사용하는 300개 이상의 언어로 일상적인 소통을 지원합니다. 이정표를 달성한 것은 의미가 있지만, 동시에 우리 미션에 필수적인 작업이 아직 남아 있음을 보여줍니다. 수십 년 동안 기술은 소수의 지배적 언어에서만 잘 작동했고, 수천 개의 살아있는 언어와 방언은 디지털 세계에서 제대로 대표되지 못하거나 아예 존재하지 않았습니다.
2006년 구글 번역(Google Translate)을 출시했을 때 우리의 목표는 단순했습니다. 언어 간 장벽을 허무는 것이었습니다. AI의 발전 덕분에 이 비전을 더 많은 사람들에게 확장할 수 있었고, 번역은 소수 언어에서 오늘날 250개 이상의 언어로 늘어났습니다. 하지만 텍스트를 번역하는 것만으로는 부족합니다. 기술은 사람들이 실제 세계에서 어떻게 소통하는지 이해해야 합니다. 그래서 우리는 문화적 뉘앙스와 인간 언어의 풍부함을 존중하는 시스템을 구축하는 데 연구개발을 집중하여, 모든 사람이 자신의 방식대로 참여하고 이해받을 수 있도록 하고 있습니다. 실제로 이런 작업이 어떻게 이루어지는지 소개합니다.
텍스트에서 진정한 이해로 지난날의 음성 인식 시스템은 딱딱한 다단계 과정을 따랐습니다. 오디오를 텍스트로 전사하고, 그 텍스트를 처리한 다음, 다시 오디오로 합성하는 방식이었습니다. 작동은 했지만, 이 파이프라인은 인간 소통에서 가장 풍부한 요소, 즉 어조, 속도, 감정, 맥락을 제거해 버렸습니다. 사람들은 완벽하게 정돈된 문법적 문장으로 말하지 않습니다. 우리는 웃고, 말을 겹치고, 머뭇거리고, 문장 중간에 여러 언어를 섞어 씁니다. 스팽글리시(Spanglish)나 힝글리시(Hinglish)를 말할 때처럼요.
이를 반영하기 위해 우리는 텍스트 전사를 넘어 네이티브 오디오 인텔리전스로 나아갔습니다. Gemini 같은 모델이 오디오를 있는 그대로 직접 처리하면서 소리와 의도를 모두 파악하도록 훈련한 것입니다. 이러한 노력에는 다음이 포함됩니다:
유려한 실시간 대화 도구: 오늘날 Gemini 3.5 Live Translate는 70개 언어와 2,000개 이상의 언어 쌍에서 실시간 음성 번역을 지원하며, 그 과정에서 코드 스위칭(언어 혼용)과 감정 신호까지 자연스럽게 포착합니다. Gemini 3.5 Transcribe는 지금까지 개발된 가장 정확한 음성-텍스트 변환 모델로, 시끄러운 환경이나 복잡한 전문 용어가 포함된 경우에도 원시 오디오를 다듬어진 정형화된 텍스트로 변환합니다. 또한 안드로이드 Gboard의 'Rambler' 기능을 지원하는데, 이 기능은 군더더기 표현을 제거하고 문법과 문장 부호를 고쳐주며, 음성 명령으로 편집·재작성하고 언어 간 매끄럽게 전환할 수 있게 합니다.
1,000개 언어 이니셔티브: AI는 이전에는 상상할 수 없었던 규모로 언어 장벽을 허물고 있습니다. 하지만 더 많은 사람들이 선호하는 언어로 다가가려면, 오늘날 AI가 가장 잘 수행하는 언어를 넘어서야 합니다. 우리의 목표는 세계에서 가장 많이 사용되는 1,000개 언어를 지원하는 것입니다. 이를 실현하기 위해 1,200만 시간의 오디오로 훈련된 유니버설 음성 모델(Universal Speech Model)은 교차 언어 전이 학습(cross-lingual transfer learning) 기법을 활용했습니다. 이는 데이터가 풍부한 언어에서 학습한 내용을 훈련 데이터가 훨씬 부족한 언어의 음성 이해력 향상에 전이할 수 있게 하는 기술로, 모델이 데이터가 풍부한 언어에서 배운 패턴을 적용할 수 있게 합니다.