메뉴

#AI모델

MP
MarkTechPost • 2일 전
IMP 7

구글, 프롬프트 기반 음성 설계 지원하는 Gemini 3.8 Flash TTS 공개

구글이 Gemini API와 Google AI Studio를 통해 새로운 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 공개했습니다. Flash TTS는 100개 이상 언어에서 자연어 프롬프트로 새로운 음성을 설계할 수 있으며, Hume AI 음성 설계 벤치마크에서 71.4점으로 1위를 기록했습니다. Flash-Lite TTS는 대량 더빙과 음성 에이전트용으로 저비용에 최적화된 모델입니다.

구글 제미나이 TTS
TD
The Decoder • 2일 전
IMP 8

구글, 텍스트 설명만으로 AI 음성을 만드는 Flash TTS 모델 공개

구글이 100개 이상 언어를 지원하는 Gemini 3.8 Flash TTS와 Flash-Lite TTS 두 음성 생성 모델을 공개했습니다. Flash TTS는 텍스트 설명만으로 새로운 음성을 처음부터 설계할 수 있고, 30초 음성 샘플로 음성 복제도 가능합니다. 두 모델 모두 대사별 연출 지시, 두 음성 대화 모드, 웃음·한숨 같은 비언어적 표현을 지원하며 Gemini API와 Google AI Studio를 통해 제공됩니다.

구글 TTS 음성생성
HN
Hacker News • 3일 전
IMP 9

앤스로픽, 클로드 오퍼스 5.5 발표

앤스로픽이 새로운 Claude 5.5 시리즈의 첫 모델인 클로드 오퍼스 5.5를 공개했습니다. 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 보이며 운영 비용은 Opus 5보다 40% 저렴하고 출력 속도도 30% 이상 빠릅니다. 안전성 면에서도 자동 행동 감사에서 역대 최고 점수를 기록했으며, 생명과학·사이버보안 등 고위험 분야는 검증된 조직에 한해 접근이 허용됩니다.

클로드 앤스로픽 AI모델
MP
MarkTechPost • 7일 전
IMP 7

SpaceXAI, 음성인식 정밀도 2배 개선한 'Grok Voice Transcribe 2.0' 출시

SpaceXAI가 배치 및 스트리밍 오디오용 음성-텍스트 변환(Speech-to-Text) 모델 'Grok Voice Transcribe 2.0'을 출시했습니다. 19개 언어에서 짧은 구문 단어 오류율이 20.6%에서 6.8%로 대폭 감소했으며, 가격은 기존과 동일하게 배치 시간당 $0.10, 스트리밍 시간당 $0.20입니다. 동일한 비용으로 정확도가 크게 향상되어 음성 처리 서비스 구축 실무자에게 중요한 소식입니다.

음성인식 AI모델 API
TD
The Decoder • 20일 전
IMP 7

구글 WeatherNext 3, 물리 시뮬레이션 없이 위성 데이터로 직접 날씨 학습

구글과 DeepMind가 발표한 AI 날씨 모델 WeatherNext 3는 기존 수치예보(NWP) 데이터 대신 실시간 정지궤도 위성 데이터를 직접 학습해, 5km 해상도의 시간 단위 예보를 제공한다. 강수량 예보 정확도를 최대 50% 향상시켰으며 풍력·태양광 발전량 추정용 데이터도 제공한다. 이 모델은 이미 구글 검색, 지도, 젬미니(Gemini)에 적용되어 있어, 고성능 지역 예보 모델이 부족했던 라틴아메리카·아프리카·아시아태평양 지역에 특히 큰 혜택이 예상된다.

구글 딥마인드 날씨예보
TD
The Decoder • 20일 전
IMP 7

메타, 끊김 없이 듣는 AI 어시스턴트의 기반 실시간 오디오 모델 공개

메타 슈퍼인텔리전스 랩스가 음성을 실시간 전사하고 화자를 20명 이상 구분하며 문장 경계까지 감지하는 'Muse Voice Transcribe' 모델을 공개했습니다. 시간당 0.18달러라는 경쟁사보다 낮은 가격과 70개 이상 언어 지원이 핵심 경쟁력이며, 이미 메타 AI와 메타 모델 API에서 사용할 수 있습니다.

메타 음성인식 실시간전사
HN
Hacker News • 21일 전
IMP 3

프로젝트 HydraFusion: 멀티모델 오케스트레이션으로 프론티어급 성능 구현

해커뉴스에 소개된 프로젝트 HydraFusion은 여러 AI 모델을 오케스트레이션(orchestration) 방식으로 조합해 단일 최신 모델에 버금가는 성능을 달성하는 접근법입니다. 다만 원문 본문 자체는 실제 기술 내용 대신 GitHub 플랫폼 홍보 문구로 채워져 있어, 프로젝트의 구체적 세부 내용은 확인이 필요합니다.

멀티모델 오케스트레이션 오픈소스
HN
Hacker News • 23일 전
IMP 8

구글 제미나이 3.8 플래시 및 사이버 보안 버전 공개

구글이 6주 만에 세 번째 플래시 모델인 제미나이 3.8 플래시를 공개했습니다. 3.7 플래시와 동일한 속도와 저렴한 가격($0.75/백만 입력 토큰)으로 소프트웨어 엔지니어링, 에이전트 작업, 다단계 추론에서 대형 프론티어 모델에 근접하는 성능을 제공합니다. 사이버보안 특화 버전인 3.8 Flash Cyber는 취약점 탐지와 자동 패치에서 최고 수준 성능을 보이며, 신뢰된 방어자들에게만 'Fairwind 프로그램'을 통해 제공됩니다.

제미나이 구글 사이버보안
MP
MarkTechPost • 24일 전
IMP 6

메타, 음성 인식·화자 구분 하나로 통합한 'Muse Voice Transcribe' 공개

메타 슈퍼인텔리전스 연구소(Meta Superintelligence Labs)가 스트리밍 음성 인식(ASR), 화자 분리(Diarization), 발화 종료 감지(Endpointing)를 단일 자기회귀(autoregressive) 모델로 통합한 'Muse Voice Transcribe'를 공개했습니다. 기존 음성 시스템이 세 개의 모델을 연결해 지연과 장애 지점을 키웠다면, 이 모델은 하나로 통합해 실시간 처리에 유리합니다.

음성인식 메타 실시간처리
MP
MarkTechPost • 25일 전
IMP 5

그래디움 AI, 신규 기본 TTS 모델 공개

Gradium AI가 새 기본 TTS(텍스트 음성 변환) 모델을 발표했다. 5개 언어의 어려운 문장 500개에 대해 사람 평가 기준 81.0% 통과율을 기록했으며, Coval 환경에서 첫 오디오까지 216ms(P50)라는 빠른 응답 속도를 보였다. 평가 데이터셋은 Hugging Face에서 CC BY 4.0 라이선스로 공개되어 있다.

텍스트음성변환 음성합성 TTS
MP
MarkTechPost • 27일 전
IMP 7

구글, 제미나이 옴니 1.1 플래시 출시…40초 장면 확장·4K 업스케일링 지원

구글이 네이티브 멀티모달 영상 생성·편집 모델의 프로덕션 업데이트인 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)를 공개했습니다. 핵심 변화는 장면 확장 시 마지막 프레임 한 장 대신 최대 10초의 이전 컨텍스트를 참조하고, 첫·마지막 프레임을 고정해 카메라 움직임을 제어할 수 있으며, 참조용 영상 클립을 전달해 캐릭터 일관성을 유지할 수 있다는 점입니다.

구글 제미나이 영상생성
TD
The Decoder • 30일 전
IMP 7

구글 제미나이 3.5 트랜스크라이브, 85개 언어 실시간 음성 인식 및 자동 교정 지원

구글이 실시간 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 공개했습니다. 85개 이상 언어를 자동 인식하며, '음...' 같은 군더더기 표현을 제거하고 실언(말실수)을 자동 교정한 뒤 텍스트를 스스로 포맷팅합니다. 스트리밍 기준 단어 오류율 4.0%, 녹음 기준 2.6%를 기록했고 이전 모델인 Chirp 3 대비 지연시간이 70% 낮아졌습니다.

구글 제미나이 음성인식
TD
The Decoder • 35일 전
IMP 7

안스로픽, 최강 모델 클로드 미토스 5를 사이버 방어에 투입

안스로픽(Anthropic)이 보안 스캐너 '클로드 시큐리티(Claude Security)'를 자사 최강 모델인 클로드 미토스 5(Claude Mythos 5)로 구동한다고 발표했습니다. 이 도구는 코드베이스의 취약점을 스캔하고 패치를 제안하며, 엔터프라이즈 고객을 대상으로 공개 베타로 제공됩니다. 모든 패치는 사람이 최종 승인해야 하며, 병원·공공시설·은행 등을 보호하는 파트너 보안 제품에도 미토스 5가 탑재됩니다.

안스로픽 보안 클로드
HN
Hacker News • 38일 전
IMP 7

클로드 다수 모델 성능 저하 사고 발생

Anthropic이 Claude Mythos 5, Opus 5, Sonnet 5, Haiku 4.5 등 다수 모델에서 요청 오류 증가(성능 저하)를 조사 중이라고 발표했습니다. 이 사고는 claude.ai, Claude API, Claude Code, Claude Cowork 전반에 영향을 미치며, 2026년 8월 18일 16:20(UTC)에 조사 시작 통지가 게시되었습니다. API와 개발 도구를 사용하는 실무자라면 서비스 지연·오류 가능성을 염두에 두어야 합니다.

클로드 앤스로픽 서비스장애
TD
The Decoder • 43일 전
IMP 8

구글, 코딩 성능 향상된 제미나이 3.7 플래시 출시

구글이 3주 전 발표한 이전 모델을 대체하여 코딩 및 AI 에이전트 성능이 대폭 강화된 '제미나이 3.7 플래시(Gemini 3.7 Flash)'를 출시했습니다. 특히 다양한 벤치마크에서 경쟁 모델들을 제쳤음에도 불구하고, 이전 모델 대비 API 사용료를 50% 인하하여 개발자들에게 매우 경제적인 선택지를 제공한다는 점이 핵심입니다.

구글 제미나이 코딩AI
TD
The Decoder • 43일 전
IMP 8

링 3.0 플래시, 동급 최고 지능의 오픈소스 AI 모델 등장

앤트 그룹(Ant Group)의 자회사 인클루전AI(InclusionAI)가 동급 크기 대비 가장 뛰어난 지능을 자랑하는 오픈소스 모델 '링 3.0 플래시(Ling 3.0 Flash)'를 공개했습니다. 이 모델은 훨씬 적은 파라미터로 Qwen3.6 27B와 맞먹는 성능을 내며, 환각 현상 비율을 44%로 크게 낮추고 에이전트 작업 능력도 향상시켰습니다. 복잡한 작업에서 토큰을 다소 많이 소모함에도 불구하고 토큰당 및 작업당 가격 경쟁력이 뛰어나 비용 효율적인 AI 구축을 원하는 실무자들에게 중요한 선택지가 될 것입니다.

오픈소스 인공지능 AI모델
TD
The Decoder • 45일 전
IMP 8

엔비디아 1조 매개변수 목표, 中 이미 추월했다

엔비디아는 최고 수준의 오픈 모델 경쟁을 위해 최소 1조 개의 매개변수를 갖춘 '네모트론 4(Nemotron 4)'를 개발 중이며, 자체 모델 훈련에 막대한 클라우드 예산을 투자하고 있습니다. 그러나 이 규모는 이미 1조 개를 훌쩍 넘긴 중국 경쟁사들에 뒤처진 수치입니다. 신모델 출시는 자사 GPU 판매 촉진이라는 이익이 있지만, 동시에 오픈AI(OpenAI)와 같은 핵심 고객사와의 직접적인 경쟁을 의미하기도 합니다.

엔비디아 네모트론4 오픈소스
TD
The Decoder • 46일 전
IMP 8

오픈소스로 돌아선 메타, '모방' 정당화하며 연산력 경매 예고

메타가 1년여 만에 소형 에이전트 모델인 '뮤즈 글리머(Muse Glimmer)'의 가중치를 오픈소스로 공개하며 다시 오픈소스 전략을 가동했습니다. 마크 저커버그는 슈퍼인텔리전스의 독점을 막기 위해 개방형 접근이 필요하다고 강조하며, 타사 모델의 출력물을 학습 데이터로 활용하는 '증류(Distillation)' 기술을 적극적으로 정당화했습니다. 이는 오픈소스 생태계의 확장과 글로벌 AI 패권 경쟁에 중요한 변곡점으로 작용할 전망입니다.

메타 오픈소스 AI모델
TD
The Decoder • 50일 전
IMP 8

오픈AI, 챗GPT GPT-5.6 솔 업데이트... 무료 사용자는 약한 모델로 제한

오픈AI가 챗GPT 유료 사용자를 위해 GPT-5.6 솔(Sol) 모델의 추론 능력과 팩트 정확도를 개선하고, 응답 깊이를 조절할 수 있는 기능을 도입했습니다. 반면 무료 사용자는 더 저렴하고 성능이 낮은 GPT-5.6 루나(Luna) 모델로 기본 제공되며, 강력한 추론 모델에 대한 접근이 제한됩니다. 이는 유료와 무료 사용자 간의 성능 및 기능 격차를 더욱 확실하게 나누는 조치입니다.

오픈AI 챗GPT GPT-5
TD
The Decoder • 52일 전
IMP 8

블랙포레스트랩스, FLUX 3 비디오 공개... 시드ance 2.0 능가

AI 기업 블랙포레스트랩스(Black Forest Labs)가 사운드가 포함된 최대 20초의 고화질 영상을 생성할 수 있는 'FLUX 3 Video' 모델을 정식 출시했습니다. 이 모델은 자체 평가 기준에서 경쟁 모델인 Seedance 2.0을 제치고 텍스트/이미지 투 비디오 부문 1위를 차지했습니다. 영상 생성 시 초 단위의 유료 과금제가 적용되며, 기본적으로 오디오 생성 기능이 포함되어 있습니다.

비디오 생성 인공지능 FLUX3
TC
TechCrunch AI • 52일 전
IMP 8

앤스로픽, AI 클라우드 스타트업 볼타와 100억 달러 계약

AI 개발사 앤스로픽(Anthropic)이 올해 설립된 AI 클라우드 스타트업 볼타(Volta)와 6년간 100억 달러 규모의 클라우드 컴퓨팅 공급 계약을 체결했습니다. 볼타는 비트디어(Bitdeer)와 협력해 노르웨이에 엔비디아(Nvidia)의 최신 '베라 루빈(Vera Rubin)' 시스템 기반 데이터센터를 구축하여 클로드(Claude) 모델 학습 및 운영에 필요한 연산력을 제공할 예정입니다. 이는 스페이스X, 아마존 등과의 최근 연이은 협력에 이어, 경쟁사들과의 치열한 AI 경쟁에서 우위를 점하기 위해 앤스로픽이 컴퓨팅 인프라를 대규모로 확보한 핵심 사례입니다.

앤스로픽 클라우드 엔비디아
TD
The Decoder • 55일 전
IMP 8

수학계를 뒤흔드는 AI: 미해결 난제 속속 풀지만 수학자들의 반응은 엇갈려

최근 AI 모델들이 인간 수학자들을 수십 년간 괴롭혀온 미해결 수학 난제들을 잇달아 풀어내며 수학계에 큰 파장을 일으키고 있습니다. 많은 수학자가 AI를 연구 생산성을 극대화해주는 '황금기'의 도구로 받아들이는 반면, 일부는 자신의 전문성이 무너질지도 모른다는 실존적 위기를 느끼고 있습니다. 인간의 직관과 AI의 막대한 연산 능력이 결합하며 수학 연구의 패러다임 자체가 완전히 뒤바뀌는 변곡점에 다다른 것으로 평가됩니다.

수학 인공지능 미해결난제
HN
Hacker News • 56일 전
IMP 9

SWE-rebench 평가: 13개 모델과 4개 에이전트 벤치마크

소프트웨어 엔지니어링 작업을 평가하는 SWE-rebench v2 리더보드의 최신 결과가 공개되었습니다. 65개 저장소에서 추출된 111개의 문제를 바탕으로 다양한 AI 코딩 모델과 에이전트의 성능, 비용, 토큰 사용량 등을 비교 분석하여 개발 실무에 활용할 수 있는 구체적인 지표를 제공합니다.

벤치마크 코딩에이전트 AI모델
TD
The Decoder • 58일 전
IMP 8

마이크로소프트 AI, 프론티어 모델 대신 소형 전문 모델로 승부한다

마이크로소프트 AI는 만능 프론티어 모델보다 토큰 효율이 높은 저비용의 소형 전문 모델을 전략적으로 채택하고 있습니다. 복잡한 작업은 OpenAI 모델에 라우팅하고 단순 작업은 저비용 전문 모델이 처리하는 오케스트레이션(Orchestration) 시스템을 통해 막대한 GPU 비용을 절감할 수 있습니다. 이는 AI 산업의 핵심 경쟁력이 단일 모델의 성능에서 작업 라우팅과 문맥 공급을 담당하는 시스템으로 이동하고 있음을 시사합니다.

마이크로소프트 AI모델 비용절감
TD
The Decoder • 59일 전
IMP 7

오픈AI 'GPT Transcribe' 공개, 성능 향상에도 경쟁사엔 못 미쳐

오픈AI가 사전 녹음 및 실시간 음성 인식에 특화된 두 가지 새로운 모델, GPT Transcribe와 GPT Live Transcribe를 API를 통해 공개했습니다. 전작 대비 전사 속도와 단어 오류율(WER)이 개선되고 가격이 인하되었지만, ElevenLabs나 구글 등 경쟁사의 오류율 기준에는 여전히 미치지 못합니다. 특히 미스트랄은 분당 0.003달러라는 저렴한 가격으로 시장 공략을 강화하고 있어 AI 음성 전사 시장의 경쟁이 더욱 치열해지고 있습니다.

오픈AI 음성인식 GPT-Transcribe
HN
Hacker News • 60일 전
IMP 6

오픈소스 모델 직접 구동, 생각보다 훨씬 자유롭다

Modal 소속 개발자가 자사의 관리형 엔드포인트에서 Kimi K3 모델을 구동하고 opencode를 연결해 본 후, 그 놀라운 자유로움에 대해 공유했습니다. 데이터 처리 과정을 온전히 통제할 수 있는 자체 호스팅 환경은 기존 폐쇄형 AI 서비스에 대한 의존도를 낮춰줍니다. 이는 개발자가 오픈소스 AI와 자체 인프라를 결합할 때 얻을 수 있는 강렬한 주도권과 해방감을 보여주는 사례입니다.

오픈소스 AI모델 개발자경험
TD
The Decoder • 60일 전
IMP 8

문샷 AI, 최고 성능 경쟁 휩쓸며 'Kimi K3' 가중치 공개

중국의 AI 기업 문샷 AI(Moonshot AI)가 최신 AI 모델인 Kimi K3의 모델 가중치(weights)와 기술 보고서를 오픈소스로 공개했습니다. 이 모델은 계산 대비 지능 효율이 높으며 서방의 최고 수준 모델들과 성능이 맞먹지만, 영국 연구소의 독자적인 테스트 결과 사이버 및 수학 분야의 성능은 뒤처져 증류(distillation) 기술 사용에 대한 의문이 제기되고 있습니다.

오픈소스 문샷AI Kimi_K3
TD
The Decoder • 60일 전
IMP 8

마이크로소프트, 자체 보안 AI 모델 발표... 여전히 복잡한 작업은 OpenAI에 의존

마이크로소프트가 비용 절감과 성능 향상을 위해 자체적인 컴팩트 보안 AI 모델인 MAI-Cyber-1-Flash를 출시했습니다. 이 모델은 대부분의 보안 작업을 처리하지만, 여전히 가장 복잡한 추론 작업에 대해서는 OpenAI 모델에 의존하는 하이브리드 방식을 취하고 있습니다. 또한, 실시간 위협 모니터링 시스템인 Perception을 도입하며 방대한 보안 데이터를 기반으로 한 AI 오케스트레이터로서의 입지를 강화하고 있습니다.

마이크로소프트 사이버보안 OpenAI
MP
MarkTechPost • 62일 전
IMP 7

사카나 AI, GPT-5.5 능가하는 사이버보안 모델 후구-사이버 공개

일본의 스타트업 사카나 AI가 오케스트레이션 모델인 '후구(Fugu)'를 기반으로 한 보안 특화 모델 '후구-사이버(Fugu-Cyber)'를 발표했습니다. 이 모델은 보안 벤치마크인 사이버짐(CyberGym)과 CTI-REALM에서 각각 86.9%, 72.1%의 높은 성능을 기록하며 최신 AI 모델들을 제쳤습니다. 해당 모델은 오용을 방지하기 위해 수동 승인 및 방어적 사용 정책 등의 엄격한 접근 제한을 거쳐 제공됩니다.

사이버보안 사카나AI 오케스트레이션
TC
TechCrunch AI • 63일 전
IMP 8

링크드인 공동창립자 등 신생 AI 연구소, 1조 원 가치로 투자 논의

링크드인 공동창립자 리드 호프만과 마크 핀커스가 참여한 신생 AI 연구소 '프렌티스(Prentis)'가 사무직 자동화 에이전트 개발을 목표로 1억 달러 규모의 투자 유치를 논의 중입니다. 이 회사는 소규모 저비용 모델을 앞세워 오픈AI 등 경쟁사 대비 압도적인 비용 효율성을 강조하며 이미 최대 5천만 달러 규모의 고객 계약을 성사시켰습니다.

인공지능 에이전트 업무자동화