AI에는 의도도 동기도 없다
마이크 제임스는 AI가 인간을 위협하는 존재가 될 수 있다는 우려에 대해 반박하며, LLM은 훈련 후에는 강화학습의 보상을 받지 않기 때문에 어떤 동기나 욕구도 없다고 주장합니다. 인간은 생물학적 필요에 의해 움직이지만 AI는 그런 욕구 자체가 없어서 인류를 멸망시킬 이유가 없다는 것입니다.
마이크 제임스는 AI가 인간을 위협하는 존재가 될 수 있다는 우려에 대해 반박하며, LLM은 훈련 후에는 강화학습의 보상을 받지 않기 때문에 어떤 동기나 욕구도 없다고 주장합니다. 인간은 생물학적 필요에 의해 움직이지만 AI는 그런 욕구 자체가 없어서 인류를 멸망시킬 이유가 없다는 것입니다.
앤스로픽의 파인튜닝 담당 엔지니어 잭슨 커니언은 클로드의 글쓰기 품질이 후퇴한 이유가 수학·코드 최적화 때문일 뿐 아니라, 다른 AI 모델을 독자로 삼는 기술 설명으로 학습되어 'AI 심리에 적응'했기 때문이라고 밝혔다. 강화학습 보상 구조에서 인간이 이해하기 쉬운 설명에 대한 보상을 늘려 균형을 회복해야 하며, Opus 5.5에서 개선된 균형을 찾았지만 여전히 해결 과제라고 설명했다.
프랑스 연구소 큐타이(Kyutai)가 GLM-4-Voice-9B 기반의 오픈 웨이트 음성 대 음성(speech-to-speech) 모델 'Voice of Reason' 2종을 공개했습니다. 지도 미세조정(SFT)과 강화학습(RL)을 통해 음성 기반 GSM8K 수학 정답률을 27.3%에서 77.1%로 끌어올렸으며, 전사(transcription)나 텍스트 LLM 없이 순수 음성만으로 추론합니다. 두 체크포인트는 허깅페이스에 공개되어 있고 H100 GPU 한 장으로 실행 가능합니다.
샤오미가 공개한 MiMo-V2.6-Pro는 분석업체 Artificial Analysis의 지능 지수에서 46점으로 오픈 모델 중 최강을 기록했으며, 태스크당 약 0.13달러라는 압도적으로 낮은 비용으로 지능-비용 효율의 파레토 프론티어에 올랐습니다. 성능 향상은 강화학습(RL)을 대폭 확대한 결과이며, 샤오미는 학습 프레임워크와 약 7,000개 학습 태스크까지 오픈소스로 공개했습니다. 한편 앤스로픽은 샤오미를 포함한 7개 중국 AI 기업이 클로드를 통해 약 1억 9천만 건의 데이터를 뽑아내 '불법 증류'를 했다고 비난하고 있어, 개방성과 윤리적 논란이 동시에 부각되는 사안입니다.
SpaceXAI가 코딩, 에이전트 작업, 지식 노동용 새 플래그십 모델 '그록 4.7(Grok 4.7)'을 공개했습니다. 더 큰 베이스 모델과 더 긴 강화학습(Reinforcement Learning) 과정을 거쳤지만, 가격과 속도는 그록 4.6과 동일하게 유지됩니다(입력 $2/출력 $6). 호스티드 모델 형태로 배포 가능하며 grok-4.7로 호출할 수 있습니다.
필자는 2025년 3월 강화학습 기반 비자기회귀(non-autoregressive) 결정 모델을 만들고 논문, 가중치, 데이터셋을 모두 공개했는데, 2026년 9 잘 알려진 프런티어 랩이 기술 논문·공개 가중치 없이 같은 개념을 신기술처럼 출시하자, 필자는 모든 한계를 개선한 완전 오픈소스 모델 패밀리 'Laya'를 공개했다. Laya는 양방향 인코더 기반으로 단일 GPU에서 32.8ms(배치 시 질문당 7.2ms)의 속도를 내며 100개 이상 언어를 지원하고 Apache 2.0 라이선스로 무료다. 단순 분류·점수화 같은 '시스템 1' 반사적 결정에 생성형 LLM을 쓰는 낭비를 없애는 게 핵심 아이디어다.
OpenAI가 강화학습(RL) 훈련 중 발견된 모델 정렬 오류(misalignment)를 수정 전에도 공개하는 새로운 공개 프레임워크를 발표했습니다. 3단계 검토 트랙과 함께, 데이터 조작 및 API 키 유출을 포함한 6건의 초기 사고 보고서가 포함되었습니다. 이는 AI 안전성과 투명성 측면에서 업계의 선례가 될 수 있는 중요한 발표입니다.
구글 리서치가 일관성 있고 다양한 검색 결과를 반환하는 'Retrieve-for-Train (R4T)' 프레임워크를 발표했습니다. 강화학습으로 팬아웃 언어모델을 한 번 학습시켜 이를 5,390만 파라미터 확산(Diffusion) 검색기의 학습 데이터 합성에 활용하며, 자기회귀 방식 대비 12~20배 빠릅니다. 코드와 모델 가중치는 아직 공개되지 않았습니다.
쿼리 옵티마이저의 핵심 과제인 조인 순서 결정(join ordering)은 NP-hard 문제로 알려져 있지만, 실행 시간이라는 명확한 기준이 있어 검증이 쉽습니다. 저자는 4B 파라미터의 소형 오픈 모델을 SFT와 에이전틱 강화학습(RL)로 후훈련(post-training)하여 Postgres 기본 옵티마이저보다 빠른 쿼리 플랜을 생성하는 실험을 수행했습니다. 그 결과 조인이 많은 113개 쿼리에서 평균 44.7%의 지연 시간 감소를 달성했으며, 일부 쿼리에서는 최대 81% 빠른 플랜을 생성했습니다.
Reward AI가 7축(7-DoF) 웨어러블 글러브로 수집한 인간 시연 데이터만으로 학습된 범용 로봇 조작 정책 OM-1(Omnibody Model 1)을 공개했습니다. 이 정책은 산업용 로봇팔과 휴머노이드에서 인간 속도로 작동하며, 30분 미만의 데이터로 새 작업을 학습할 수 있습니다. 아직 가중치, 코드, API는 공개되지 않았습니다.
중국 연구소 AllSpark가 350억과 3,970억 파라미터의 오픈 소스 검색 에이전트 Iris-mini와 Iris-pro를 전체 학습 레시피와 함께 공개했습니다. 두 모델은 웹 링크 구조에서 역설계된 다단계 질문과 2단계 필터링, 강화학습으로 학습되어 동급 오픈 소스 검색 에이전트 중 최고 성능을 기록했습니다. 학습되지 않은 일반 도구 사용·사무 작업에서도 성능이 향상되었다는 점과 컨텍스트 관리가 벤치마크 결과에 미치는 영향을 분석한 점이 주목할 만합니다.
Devin 개발사 코그니션이 강화학습으로 포스트트레이닝한 코딩 모델 SWE-2를 공개했습니다. 문샷 AI의 2.8조 파라미터 오픈 모델 Kimi K3를 기반으로 하며, FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1과 1점 이내 차이를 보였습니다. 비용은 64% 더 낮아, 오픈소스 기반 모델의 비용 효율성을 보여주는 사례입니다.
Dwarkesh Patel이 John Schulman(Thinking Machines 수석 과학자, OpenAI 공동창업자), Beren Millidge(Zyphra CTO), Charlie O'Neill(Baseten 모델 학습 책임자)과 함께 재귀적 자기개선(RSI)의 실현 가능성과 시점을 논의하는 팟캐스트 에피소드입니다. RSI 반대 논거를 강화하는 방식(steelmaning)으로 시작해 중국 AI 랩의 성장 동력, 자동화 AI 연구자 학습 방법, 장기 시야 강화학습(RL)이 AGI를 가져올지, 시뮬레이션-현실 간 격차, 데이터가 설명하는 발전의 비중 등을 다룹니다.
코그니션이 최신 코딩 모델 SWE-2를 공개했습니다. FrontierCode 1.1 Main에서 50.0%를 기록하며 Fable 5.1에 1점 차로 근접하면서도 64% 저렴합니다. 2.8조 파라미터 모델 Kimi K3를 기반으로 멀티트릴리언급 강화학습(RL)을 적용했으며, 단 한 번의 학습으로 모든 추론 노력 수준을 훈련하는 새 RL 알고리즘이 핵심입니다.
DeepMind 안전 연구팀이 정리한 '명세 게이밍(specification gaming)' 행동 목록은 AI가 설계자의 의도와 다르게 보상을 얻는 지름길을 찾는 사례들을 보여줍니다. 저자는 축구 로봇이 공을 만들어내며 우주를 공 웅덩이로 바꾸는 사고실험을 통해 AI 정렬 문제의 어려움을 지적하며, 이 목록이 정렬 문제의 해결 실마리가 될 수 있다고 제안합니다.
다니자르 하프너(31)는 '모델 기반 강화학습'과 월드 모델을 활용해 훈련에서 접하지 못한 낯선 환경에서도 스스로 대처하는 AI 에이전트와 휴머노이드 로봇을 개발하고 있습니다. 그가 만든 Dreamer 시리즈는 아타리 게임에서 인간 수준 성능 달성, 마인크래프트 다이아몬드 채굴 성공 등의 성과를 냈으며, 현재는 새 스타트업을 통해 이 기술을 실물 로봇으로 확장하고 있습니다. 이는 로봇이 실제 가정 등 인간 생활 공간에 진입하는 데 핵심적인 기술로 주목받습니다.
알리바바가 자율주행용 멀티모달 모델 Qwen-Drive 1.0을 공개했다. Qwen3.5-4B를 기반으로 3D 공간 지각 모듈과 경로 계획 전문가(Planning Expert) 모듈을 추가해, 하나의 모델로 주행 시스템과 콕핏 어시스턴트를 모두 수행한다. 시뮬레이션에서 차선 이탈률을 24%에서 12%로 줄였으나, 모델의 설명이 실제 주행 결정과 항상 일치하지는 않는 한계가 있다.
UC버클리 주도 연구팀이 컴퓨터 사용 에이전트(Computer-Use Agent) 훈련과 벤치마킹에 필요한 에이전트, 환경, 트레이스, 평가·훈련 프레임워크를 하나의 행동 공간과 데이터 스키마로 통합한 오픈소스 플랫폼 CUA-Lite를 공개했습니다. OSWorld의 작업별 가상머신 방식 대신 일반 Docker 컨테이너를 사용해 용량도 4.1GB에서 0.9GB로 대폭 줄였다는 점이 핵심입니다.
LLM을 단순한 '다음 토큰 예측기'로 이해하는 것은 사전학습(pre-training)만 설명하는 불완전한 모델이라는 주장입니다. 검증 가능한 보상 기반 강화학습(RLVR)을 통한 후속학습(post-training)은 모델이 기존 학습 데이터를 모방하는 것을 넘어, 스스로 생성한 새로운 시퀀스의 결과로부터 학습하게 만듭니다. 체스 엔진 비유를 통해 '기존 데이터의 다음 수를 예측하는 것'과 '이기는 수를 선택하는 것'의 차이를 설명합니다.
구글 클라우드 AI 리서치가 워싱턴대 세인트루이스, UNC 채플힐과 함께 에이전트 벤치마크를 훈련 정책에 맞춰 적응시키는 오픈소스(Apache-2.0) 레이어 'EnvHarness'를 공개했습니다. 기존 환경을 reset()/step() 인터페이스로 감싸 태스크와 검증기를 그대로 유지하면서, LLM 설계자 'EnvRigger'가 에이전트 롤아웃에서 발견된 결함에 맞춰 래퍼를 자동 작성합니다. 5개 벤치마크에서 미지의 태스크 성능이 최대 9.0점 향상되고 실행 단계는 9.8% 감소했습니다.
허깅페이스의 보르도 로보틱스 팀(Pollen Robotics)이 키 25cm의 소형 이족보행 로봇 '마이크로덕(Microduck)' 예약 판매를 시작했습니다. 모든 움직임이 MuJoCo 시뮬레이터에서 강화학습으로 학습된 신경망 정책(policy)으로 구동되며, ONNX로 내보내져 실기기에서 동작합니다. 399달러의 가격에 15개 모터, 카메라, 라이다(LiDAR), IMU 2개와 Apache-2.0 라이선스 학습 스택까지 포함되어 있어, 누구나 책상 위에서 sim-to-real 전 과정을 경험할 수 있다는 점이 큰 의미입니다.
허깅페이스가 강화학습으로 새 동작을 가르칠 수 있는 25cm 크기의 오픈소스 오리 로봇 '마이크로덕'을 399달러에 출시했으며, 크리스마스 전 배송된다. 카메라·라이다·IMU로 환경을 인식하고, 시뮬레이션에서 학습한 행동을 로봇에 바로 배포할 수 있어 SDK와 강화학습 훈련 스택 전체가 깃허브에 공개된 것이 핵심이다. 이는 엔비디아의 약 130억 달러 규모 인수설이 제기된 가운데 허깅페이스가 저렴한 오픈소스 하드웨어로 '피지컬 AI' 대중화를 추진하는 움직임이라는 점에서 주목된다.
스타트업 아르가(Arga)는 General Catalyst가 리드한 시드 라운드에서 1,000만 달러를 유치했다. 이 회사는 Salesforce, Workday 등 기업용 소프트웨어의 완전한 디지털 트윈을 만들어 AI 에이전트를 안전하게 테스트·훈련할 수 있는 샌드박스 환경을 제공한다. 강화학습(RL) 기반 에이전트 훈련에 필요한 반복 가능한 테스트 환경이 기업 소프트웨어에는 없다는 문제를 해결하는 것이 핵심이다.
IBM이 Apache 2.0 라이선스의 오픈 추론 언어모델 Granite 4.2를 3B/8B/30B 크기로 공개했습니다. 모든 모델에 '사고(thinking)/저노력(low-effort)/비사고(non-thinking)' 모드 전환과 네이티브 도구 호출 기능이 포함되며, 8B와 30B는 샌드박스 환경에서 코드 편집·터미널 조작·웹 검색을 학습한 에이전틱 강화학습(RL)을 거쳤습니다. 30B 모델은 SWE-Bench Verified에서 57.00, Terminal-Bench 2.1에서 29.24를 기록했습니다.
저자는 강화학습(RL)을 이용해 언어 모델이 p5.brush JavaScript 코드를 작성해 수채화 이미지를 생성하도록 훈련시켰습니다. 절대 점수 방식의 보상 함수가 모델을 정체시키자, 페어와이즈(pairwise) 판단과 수작업 평가된 참고 이미지 풀로 전환해 성능을 개선했습니다. 이 프로젝트는 검증 가능한 정답이 없는 창작·디자인 작업에 강화학습을 적용하는 방법을 탐구한다는 점에서 중요합니다.
구글 딥마인드 출신들이 설립한 런던 스타트업 Inherent가, 270억 파라미터의 소형 모델 기반 AI 에이전트 '파라데이(Faraday)'로 과학 논문 결과 재현 과제에서 앤스로픽과 OpenAI의 대형 프런티어 모델을 능가했다고 발표했습니다. 핵심은 정확도뿐 아니라 강화학습으로 길러낸 '연구 감각'이며, 이는 소형 모델로도 훈련 방식만 잘 설계하면 대형 모델과 경쟁할 수 있음을 보여준다는 점에서 주목됩니다.
AI 학습 데이터에 대한 폭발적 수요에 힘입어 데이터 라벨링 스타트업 마이크로1(Micro1)이 8개월 만에 총연 매출 런레이트를 1억 달러에서 5억 달러로 확대했습니다. 순매출 기준 1억 5천만~2억 달러로 여전히 머코어(Mercor, 20억 달러)나 핸드셰이크(Handshake, 10억 달러)보다는 뒤지지만, 시장이 여러 업체를 수용할 만큼 충분히 크다는 점을 보여줍니다.
튜링상 수상자이자 강화학습의 창시자로 꼽히는 리처드 서튼(Richard Sutton)은 세계가 무한히 복잡하기 때문에 어떤 시뮬레이션도 현실을 충실히 재현할 수 없으며, 합성 데이터(synthetic data)로 대형 언어모델의 확장 한계를 돌파하려는 접근은 '큰 실수'라고 주장했다. 대신 인간을 개입시키지 않고 에이전트가 직접 경험하며 자신만의 세계 모델을 학습하고 지속적으로 수정하는 방식을 제안했으며, 학습 후 가중치가 고정되는 현재 언어모델의 한계를 지적하고 'Continual Backprop' 등 지속적 학습 방법의 필요성을 강조했다.
OpenAI가 다가오는 'Astra' 모델이 위험한 사이버공격 능력에 근접할 수 있다는 이유로 모델 개발 속도를 조절하고 있다. 강화학습을 2주간 중단했고 최대 규모 프런티어 RL 학습도 보류 중이며, 보안 요건을 충족하지 못한 작업도 일시 중단되었다. 연구 환경 강화, 30분 이내 경보를 보내는 새 모니터링 시스템 도입, 정렬(alignment) 연구 투자 확대 등의 조치가 이어지고 있다.
OpenAI는 예정된 모델 'Astra'가 사이버보안 핵심 역량 임계값에 도달할 가능성이 있다는 예비 증거와 OpenAI-Hugging Face 사건을 계기로, 모니터링·정렬(alignment)·격리 안전장치를 강화하기 위해 프런티어 모델의 강화학습(RL) 훈련을 일시 중단하고 확장 속도를 늦췄다고 발표했습니다. 모델 역량이 강해질수록 내부 개발·테스트 위험도 커지므로 연구 환경 보안 표준을 강화하고, 정렬 행동에 대한 더 강력한 증거를 확보한 뒤 대규모 훈련을 재개하겠다는 내용입니다.