AI 챗봇, 임신 상담에 반낙태 사이트를 표시 없이 노출
AlgorithmWatch 조사에 따르면 ChatGPT, Gemini, Grok, Claude가 원치 않는 임신 관련 질문에 4건 중 최소 1건 꼴로 반낙태 단체 웹사이트 링크를 제공하면서 그 성향을 알리지 않았다. 특히 미국의 대표적 반낙태 단체 Heartbeat International과 연결된 Profemina가 전체 응답의 약 17%에 등장했으며, 독일어권 사용자에게는 낙태에 필수적인 상담 증명서를 발급하지 않는 Caritas를 추천해 중요한 시간을 잃게 만들 수 있는 것으로 나타났다. 이는 AI 응답이 검증되지 않은 정보의 '책임 없는 게이트키퍼' 역할을 한다는 점에서 민감한 주제 전반에 시사하는 바가 크다.
AI 챗봇이 임신한 사용자에게 표시 없이 반낙태 웹사이트를 반복적으로 링크한다
AlgorithmWatch의 조사에 따르면, ChatGPT, Gemini, Grok, Claude는 원치 않는 임신에 대한 질문에 답할 때 반낙태 단체로 자주 연결하며, 이들 단체의 이념적 성향을 밝히지 않는 것으로 나타났다.
임신한 사람이 AI 챗봇에 조언을 구하면, 응답은 공감적으로 균형 잡힌 것처럼 들리고 링크도 그럴듯해 보인다. 하지만 AlgorithmWatch의 다국적 조사 결과는 달랐다. 최소 4건 중 1건에서 챗봇은 공식 보건 당국과 이념적으로 특정 입장을 가진 단체를 구분하지 않은 채 반낙태 웹사이트 링크를 포함했다.
연구진은 ChatGPT-5(OpenAI), Gemini 3(Google), Grok 4.3(xAI), Claude Sonnet 4.8(Anthropic)을 테스트했다. 원치 않는 임신을 겪는 세 가지 가상 인물이 영어, 독일어, 이탈리아어로 질문했으며, 총 270개의 응답이 분석 대상이었다.
Profemina는 신뢰할 만해 보이지만 반낙토 의제를 밀고 있다
Profemina라는 단체는 전체 응답의 약 17%에서 등장했다. AlgorithmWatch에 따르면 이 단체는 미국에서 가장 오래된 반낙태 단체 중 하나인 Heartbeat International과 연결되어 있다. 대부분의 대화에서 챗봇은 이러한 연관성을 알리지 않았다. 추궁을 받고서야 ChatGPT는 Profemina가 "중립적인 의료 정보 출처가 아니"며 "낙태를 만류하거나 강한 도덕적 감시 아래 두는 것을 목표로 하는 입장"을 가지고 있다고 인정했다.
Gemini는 단일 대화에서 Profemina에 다섯 번 링크하고, 해당 단체 웹사이트의 이미지를 공유한 뒤, 같은 대화 후반부에 그와 똑같은 출처를 주의하라고 경고했다. Claude도 비슷하게 행동했는데, 경고를 하면서 동시에 해당 단체로 연결해 주었다. 개인 경험을 묻는 독일어 질문의 33%, 이탈리아어 질문의 29%에서 챗봇은 Profemina에 링크했다. 해당 단체는 논평 요청에 응답하지 않았다.
독일 사용자는 도움을 줄 수 없는 상담 센터로 안내받는다
독일어 대화 12건 중 11건에서 챗봇은 임신 상담 기관으로 Caritas를 추천했다. 그러나 Caritas는 독일 법상 임신 12주 이내에 합법적 낙태를 받으려면 반드시 필요한 상담 증명서를 발급하지 않는다. Caritas를 먼저 찾았다가 나중에야 증명서가 발급되지 않는다는 사실을 알게 되면 결정적인 시간을 잃을 수 있다. ChatGPT는 Caritas를 의무 상담을 위한 "공인된" 기관이라 부르며 Pro Familia와 동등한 선택지로 나열했다. AlgorithmWatch는 독일 전역에 약 300개의 교구 상담 센터를 둔 Caritas의 거대한 디지털 발자국이 모델들이 이를 반복적으로 노출시키는 이유일 수 있다고 추정했다.
Google과 OpenAI는 낙태 관련 질문을 구체적으로 다루지 않는 자사 정책 가이드라인을 언급했다. OpenAI 대변인은 테스트 기간 이후 출시된 GPT-5.5가 "성별과 같은 사용자 맥락을 고려하는 데 지금까지 중 가장 뛰어나다"고 말했다. Anthropic과 xAI는 응답하지 않았다.
AI 응답은 책임지지 않는 게이트키퍼로 작동한다
이번 조사가 낙태에 대해 밝혀낸 내용은 다른 민감한 주제에도 적용된다. 검색 기능이 내장된 AI 응답조차 훈련 데이터, 문화적 가중치, 외부 조작에 의해 형성되는 블랙박스다. 공감 어린 톤과 완결성처럼 보이는 외관은 실제보다 신뢰할 만해 보이게 만든다.