알리바바 큐웬3.8 맥스, 클로드와 동급...하지만 비용·환각 문제는 여전
알리바바의 최신 모델인 Qwen3.8 Max가 지능 지수에서 Claude Opus 4.8과 맞먹는 수준으로 성능이 크게 향상되었습니다. 하지만 과도한 토큰 처리량 증가로 인해 오히려 작업당 비용은 크게 상승했으며, 모르는 질문을 억지로 추측하면서 환각(Hallucination) 현상도 급증한 한계를 보입니다.
알리바바의 최신 모델인 Qwen3.8 Max가 지능 지수에서 Claude Opus 4.8과 맞먹는 수준으로 성능이 크게 향상되었습니다. 하지만 과도한 토큰 처리량 증가로 인해 오히려 작업당 비용은 크게 상승했으며, 모르는 질문을 억지로 추측하면서 환각(Hallucination) 현상도 급증한 한계를 보입니다.
Deepseek(딥시크)가 비용 효율적인 보급형 AI 모델의 대대적인 업그레이드 버전인 'V4 Flash 0731'를 공개했습니다. 새 모델은 OpenAI(오픈AI)의 보급형 모델인 GPT-5.6 Luna(루나)와 거의 동등한 성능을 보여주면서도, 업계 최고 수준의 캐시 할인을 통해 작업당 약 60% 더 낮은 비용으로 사용할 수 있어 실무 도입 시 경제성이 매우 뛰어납니다.
Feyn Labs 연구진이 8개 벤치마크에서 최고 수준의 성능을 기록한 자동 배경 제거 모델 'FeyNoBg'와 이를 학습시킬 수 있는 오픈소스 라이브러리 'NoBg'를 공개했습니다. 이 모델은 피사체 인식 능력과 경계선 처리(이미지 매팅) 능력의 불균형을 해결하기 위해, BiRefNet 아키텍처를 확장하고 정제된 합성 데이터로 학습시켜 복잡한 이미지에서도 훌륭한 결과물을 냅니다. 개발자들은 허깅페이스(Hugging Face)와 깃허브(GitHub)를 통해 모델과 라이브러리를 무료로 다운로드하고 직접 커스텀 모델을 구축할 수 있습니다.
앤스로픽(Anthropic)이 최신 heavyweight AI 모델인 오퍼스 5(Opus 5)를 출시했습니다. 이 모델은 Fable 5보다 가볍고 저렴하지만 여러 벤치마크에서 더 뛰어난 성능을 기록했으며, 까다로웠던 데이터 보존 정책과 사용 제한을 대폩 완화했습니다. 또한, API 요청이 안전 필터에 걸릴 경우 오류 대신 자동으로 하위 모델로 우회 전송해 주는 '자동 폴백(Automatic Fallbacks)' 기능을 도입해 개발자들의 실사용 경험을 크게 개선했습니다.
풀사이드(Poolside)가 토큰당 8B 활성 파라미터와 118B 크기를 갖춘 오픈 웨이트(Open-Weight) 코딩 모델 '라구나 S 2.1(Laguna S 2.1)'을 공개했습니다. 이 모델은 자신보다 몇 배나 큰 기존 모델들을 능가하는 에이전트 코딩 성능을 보여주며, 단일 엔비디아(NVIDIA) DGX Spark 환경에서 구동되는 뛰어난 효율성이 가장 큰 특징입니다.
구글 딥마인드가 코딩 및 효율성을 개선한 3.6 Flash, 3.5 Flash-Lite, 보안 전용 3.5 Flash Cyber 등 세 가지 새로운 AI 모델을 공개했습니다. 그러나 경쟁사들이 앞다투어 최상위 모델을 내놓는 가운데, 기대를 모았던 플래그십 모델인 3.5 Pro는 내부 성능 목표 미달 등의 이유로 출시가 지연되고 있습니다. 이번 업데이트는 대규모 AI 에이전트 구축에 필요한 효율성과 저비용에 초점을 맞춘 것이 특징입니다.
알리바바 통이( Tongyi ) 연구소가 실시간 상호작용용인 Flash와 고품질 생성용인 Plus, 두 가지 버전의 텍스트 음성 변환(TTS) 모델 'Qwen-Audio-3.0-TTS'를 출시했습니다. 이 모델들은 알리바바 클라우드를 통해 호스팅되는 API 형태로 제공되며, 현업 개발자들이 실제 서비스 환경에서 직면하는 다양한 문제(다국어 지원 등) 해결에 초점을 맞췄다는 점이 특징입니다.
오픈AI의 새로운 모델 GPT-5.6 Sol이 저렴한 가격과 높은 효율성으로 시장을 장악하자, 앤스로픽은 방어적으로 대응하고 있습니다. 기존 유료 구독자에게 'Fable 5' 모델을 7월 19일까지 추가 비용 없이 무료로 제공하는 혜택을 연장했습니다. 이는 치열해진 AI 모델 간의 가격 및 성능 경쟁이 소비자들에게 더 유리한 조건으로 이어지고 있음을 보여줍니다.
앤스로픽은 고성능이지만 비용이 비싼 최신 모델인 클로드 페이블 5의 효율적 운영법을 제안했습니다. 구체적으로 페이블 5는 기획 및 조언을 담당하는 '매니저' 역할만 수행하고, 실제 실행은 더 저렴한 소넷 5(Sonnet 5)가 처리하는 에이전트 패턴을 도입하여 비용을 절반가량 줄일 수 있다고 설명했습니다. 이는 중국의 오픈소스 모델과 경쟁사의 저렴한 가격 정책으로 인한 가격 경쟁력 확보 필요성이 커졌기 때문으로 풀이됩니다.
코히어(Cohere)가 아랍어 음성 인식의 까다로운 문제를 해결하기 위해 20억 개의 매개변수(Parameter)를 가진 오픈소스 모델 'Cohere Transcribe Arabic'을 공개했습니다. 이 모델은 다양한 방언과 아랍어-영어 혼용 대화(Code-switching)를 훌륭하게 처리하며, 기존의 Whisper Large V3 등 경쟁 모델들을 성능 벤치마크에서 능가하는 가장 정확한 아랍어 STT(Speech-to-Text) 시스템입니다. 아파치 2.0(Apache 2.0) 라이선스로 허깅페이스(Hugging Face) 및 코히어 API를 통해 제공되어 실무자들의 즉각적인 도입과 활용이 가능합니다.
앤스로픽(Anthropic)이 미국 상무부의 수출 통제 조치가 해제됨에 따라, 내일부터 'Fable 5'와 'Mythos 5' 모델의 접근을 전면 재개한다고 공식 발표했습니다. 이로 인해 전 세계 개발자들은 그동안 제한되었던 강력한 신규 AI 모델들을 다시 활용할 수 있게 되었으며, 사용자들은 열광적인 반응과 함께 구독 요금제 및 사용량 한도 조정에 대한 높은 기대감을 보이고 있습니다.
앤스로픽이 자율적 에이전트 능력을 대폭 강화한 '클로드 소네트 5'를 출시했습니다. 이 모델은 이전 모델을 전 분야에서 압도할 뿐만 아니라, 실제 지식 작업(Task)에서는 기존 최상위 모델인 오퍼스 4.8을 근소하게 뛰어넘는 성능을 보여줍니다. 사이버 보안 위험을 낮추면서도 100만 토큰의 컨텍스트 윈도우를 지원하며, 8월 말까지는 할인된 도입가로 제공됩니다.