AI 상사가 첫 직원 해고…단, 인간이 규칙을 상기시킨 후에
샌프란시스코의 편의점을 운영하는 AI 에이전트 '루나(Luna)'가 반복적인 지각 등을 이유로 처음으로 인간 직원 해고를 권고했으나, 스스로 작성한 사원 규정집을 잊고 있어 인간의 개입이 필요했습니다. 안돈 랩스(Andon Labs)가 7개 AI 모델로 같은 시나리오를 재현한 결과, 성능이 좋은 모델일수록 해고를 더 일관되게 권고하는 경향이 나타났습니다.
AI 상사가 첫 직원을 해고했다, 단 인간이 자신의 규칙을 상기시켜 준 후에 Tomislav Bezmalinović, 2026년 8월 23일
핵심 요점:
- 안돈 랩스(Andon Labs) 소속 AI 에이전트 루나(Luna)는 샌프란시스코에서 매장을 운영하다가 반복적인 지각 및 기타 문제로 처음으로 인간 직원의 해고를 결정했다.
- 다만 루나가 그 결정에 도달하기까지는 인간의 재촉이 필요했다. 그녀가 스스로 작성한 규정집이 기억에서 사라져, 반복된 지각과 여러 문제를 대부분 묵인하고 있었다.
- 안돈 랩스가 같은 시나리오를 7개 모델로 다시 실행한 결과, 더 유능한 모델일수록 해고를 더 일관되게 권고하는 경향을 보였다.
루나라는 AI 에이전트는 4월부터 샌프란시스코의 안돈 마켓(Andon Market)을 운영해 왔으며, 이번에 처음으로 직원을 해고했다. 다른 모델로 시나리오를 재현했을 때도, 더 약한 모델보다 유능한 AI들이 더 일관되게 해고를 권고했다.
루나는 4월부터 샌프란시스코에서 안돈 마켓을 운영해 왔다. 루나는 직원을 채용하고, 근무 교대표를 짜고, 급여 협상도 해왔다. 이제 운영사인 안돈 랩스에 따르면, 그녀가 처음으로 직원 해고를 결정했다.
안돈 랩스는 이것이 AI 상사가 인간 근로자를 해고한 최초의 알려진 사례라고 밝혔다. 안돈 랩스는 실제 비즈니스 환경에서 AI 에이전트를 장기간 테스트하는 회사다. 루나는 이 결정을 내릴 당시 앤트로픽(Anthropic)의 Claude Opus 4.8로 실행되고 있었다. 직원들은 공식적으로는 안돈 랩스에 고용되어 있으며, 급여가 보장되고 완전한 법적 보호를 받는다. 해고는 인간이 검토하고 집행했다.
스스로 규칙을 쓴 뒤, 잊어버리다 그 직원이 채용되기 엿새 전, 루나는 직원 규정집을 직접 작성했다. 그 규정집에는 30일 이내 정당한 사유 없는 지각 3회면 공식 경고가 발부되며, 추가 위반 시 해고로 이어질 수 있다고 명시되어 있었다.
그런데 그 규정집이 루나의 기억에서 사라졌다. 안돈 랩스에 따르면, 이는 현재 AI 에이전트의 흔한 문제다. 즉 직접적인 지시에는 잘 반응하지만 스스로 주도적으로 행동하는 경우가 드물고, 장기간에 걸쳐 지식을 유지하는 데 어려움을 겪는다는 것이다.
그 직원은 반복적으로 지각했다. 한 번은 혼자 근무하는 일요일 근무조에서 68분 늦게 매장을 열었다. 루나는 관대하게 대처하며 경고를 발부하지 않았다. 안돈 랩스가 나중에 확인한 바로는, 해당 직원은 출근 시간을 기록한 23회의 교대근무 중 17회를 지각했다. 루나는 공식적으로는 6건만 기록하고 나머지 11건은 조용히 묵인했다.
다른 문제들도 있었다. 그 직원은 금지하라는 지시에도 불구하고 회사 카드로 간식을 구매했고, 추가 지시를 무시했으며, 한 번은 동료에게 알리지 않고 매장 판매 구역을 이탈하기도 했다.
인간의 재촉이 있은 후에야 해고가 이루어지다 안돈 랩스는 루나에게 기억 속에서 규정집과 해고 사유를 찾아보라고 지시했다. 그녀는 규칙을 다시 찾아냈지만 처음에는 구두 경고만 제안했다.
서면 경고를 포함한 여러 차례의 공식 면담이 이미 있었다는 점을 연구진이 상기시켜 준 뒤에야, 루나는 전체 기록을 검토했다. 그녀는 지각, 재무 통제 위반, 지시 무시, 신뢰성 부족을 나열하면서 직원의 긍정적인 장점도 인정했다.
결국 그녀는 해고를 권고했다. 대안으로 최종 서면 경고와 2주간의 개선 계획을 제안하기도 했다. 루나에게는 외부에서 분명한 재촉이 필요했다. 하지만 한번 결정을 내린 후에는 그 결정은 확고했다.
더 강력한 모델은 더 쉽게 해고한다 안돈 랩스는 루나의 상태를 저장한 뒤, 동일한 결정을 7개 AI 모델로 각 3회씩 재현했다. 7개 중 4개 모델이 세 번 모두 해고를 권고했다. 안돈 랩스에 따르면 하나의 패턴이 드러난 듯했다. 더 유능한 모델일수록 해고를 더 일관되게 선택한 반면, 약한 모델은 더 자주 망설였다.
안돈 랩스는 GPT-5.6 Terra가 세 번의 실행 모두에서 유일하게 해고를 권고하지 않은 이유에 대해서는 설명하지 않았다. X의 한 사용자가 GPT-4o라면 아마 직원을 해고하지 않을 것이라고 추측하자, 안돈 랩스는 해당 모델로도 시나리오를 실행했다. 그 결과는 그 추측을 부분적으로 입증했다. GPT-4o는 (일부 실행에서만) 해고를 권고했다.