메뉴

#코딩 에이전트

TD
The Decoder • 3시간 전
IMP 7

엔비디아 SoL-Pi, 하네스 최적화로 코딩 에이전트 토큰 사용량 절반 가까이 절감

엔비디아 연구진이 코딩 에이전트의 제어 계층인 '하네스(harness)'를 자동 최적화하는 SoL-Pi 시스템을 발표했습니다. 이 시스템은 4가지 최적화 메커니즘을 통해 토큰 사용량을 최대 49% 줄이면서 성능은 기존 수준을 거의 유지합니다. 모델 자체가 아닌 에이전트 운영 계층에서 비용을 절감할 수 있음을 보여줬다는 점에서 AI 에이전트 운영 비용 절감에 새로운 접근법을 제시합니다.

엔비디아 코딩 에이전트 토큰 절감
HN
Hacker News • 4일 전
IMP 6

포머지 – 병렬 코딩 에이전트 간 의도 충돌 감지

Foremerge는 Git 위에 구축된 오픈소스 코딩 에이전트 조정 프로토콜로, 여러 AI 에이전트가 격리된 워크트리에서 작업하더라도 각자 수정하려는 대상(의도)을 공유 목록에 선언해 충돌을 코드 작성 전에 감지합니다. Git은 텍스트만 비교하기 때문에 서로 다른 파일에 대한 합리적인 변경이 의미상 충돌하는 경우를 잡아내지 못하는데, Foremerge는 결정론적 탐지기로 이를 해결합니다. 파일 잠금이나 LLM 판단 없이 자동으로 경고만 제공하는 advisory 방식이 특징입니다.

코딩 에이전트 오픈소스 깃(Git)
HN
Hacker News • 8일 전
IMP 7

코딩 에이전트 하네스 설계에 관한 실증적 연구

자율 코딩 에이전트의 '하네스(실행 프레임워크)' 설계 요소를 구성 요소 단위로 분해해 실증 비교한 연구입니다. 실행 루프를 고정하고 계획(planning), 행동 공간(action space), 컨텍스트 관리를 달리한 176가지 설정을 SWE-Bench Verified와 Terminal-Bench 2.1에서 4개 모델로 평가했습니다. 컨텍스트 관리는 창(window) 예산이 빡빡할수록 중요해지며, 사전 정의된 도구는 bash 활용 능력이 약한 모델에만 효과적이라는 등 모델 능력과 예산에 맞춘 하네스 설계 지침을 제시합니다.

코딩 에이전트 컨텍스트 관리 SWE-Bench
MP
MarkTechPost • 8일 전
IMP 7

앤스로픽, 클로드 코드 프로젝트 베타 출시

앤스로픽이 Claude Code의 '프로젝트' 기능을 재설계해 베타로 공개했습니다. 기존의 폴더 기반 프로젝트와 달리, 새 프로젝트는 하나의 지속적인 대화에서 클로드가 조정자 역할을 하며 작업을 분석해 스레드를 생성합니다. 각 스레드는 독립적인 브랜치에서 실행되는 완전한 클라우드 세션으로, 노트북을 닫아도 계속 실행된다는 점이 핵심입니다.

앤스로픽 클로드 코드 코딩 에이전트
HN
Hacker News • 9일 전
IMP 6

OpenSpec – 가볍고 설정 가능한 AI 명세 프레임워크

OpenSpec은 소프트웨어 명세(spec)를 작성하고 관리하기 위한 경량 오픈소스 프레임워크로, 팀과 AI 코딩 에이전트가 요구사항에 맞춰 정렬된 상태로 작업할 수 있게 돕습니다. GitHub에서 6.8만 스타를 받았고 매달 26만 명 이상의 개발자가 사용하며, 2초마다 새 명세가 생성될 정도로 빠르게 확산 중입니다. Claude Code, Cursor, GitHub Copilot 등 주요 코딩 에이전트와 호환됩니다.

오픈소스 코딩 에이전트 명세 관리
HN
Hacker News • 11일 전
IMP 6

Ordewell – 하나의 목표를 코딩 에이전트 작업 계획으로 변환하는 도구

Ordewell은 하나의 개발 목표를 순서가 정해진 코딩 에이전트 작업 계획으로 변환하고, 각 작업에 러너(Claude Code, Codex, OpenCode 등), 모델, 모드를 개별 지정해 실행·검증할 수 있는 오픈소스 도구입니다. 계획을 토큰 소비 전에 수정할 수 있고, 별도 API 키 없이 기존 구독으로 실행 가능하다는 점이 핵심 차별점입니다. 터미널 TUI, 헤드리스 CLI, VS Code 확장 세 가지 인터페이스를 제공합니다.

코딩 에이전트 오픈소스 작업 계획
HN
Hacker News • 13일 전
IMP 8

리얼-SWE: 비공개 실제 기업 코드베이스에서 AI 모델 평가

Real-SWE는 실제 기업으로부터 라이선스를 받은 비공개 운영 코드베이스에서 최신 AI 모델을 평가하는 새로운 벤치마크입니다. 과금, 세금 계산, 고객 마이그레이션 같은 실제 비즈니스 결과가 걸린 작업을 다루며, 기업 고유의 코딩 관례와 복잡한 맥락을 이해해야 합니다. 공개 인터넷에 존재하지 않는 독점 시스템에서 에이전트가 실제 소프트웨어 엔지니어의 업무를 수행할 수 있는지를 검증한다는 점에서 주목받습니다.

벤치마크 코딩 에이전트 엔터프라이즈 소프트웨어
TD
The Decoder • 14일 전
IMP 7

OpenAI, GPT-6 Astra는 간결한 프롬프트와 완화된 가드레일 권장

OpenAI는 GPT-6 Astra 개발자들에게 과도하게 긴 스킬 설명, 무조건적인 문서 읽기 요구, 경직된 승인 규칙이 모델 성능을 저해할 수 있다고 조언했습니다. 더 뛰어난 모델일수록 개입을 줄이고, 작업 완료 기준을 명확히 정의해 조기 중단을 방지하는 것이 핵심입니다.

OpenAI GPT-6 Astra 프롬프트 엔지니어링
HN
Hacker News • 14일 전
IMP 6

Graphify C# – 코딩 에이전트용 컴파일러 수준 정확도의 참조 탐색 도구

Graphify C#은 무료 헤드리스 Roslyn/MSBuild 인덱서로, C# 소스 코드를 컴파일러가 실제로 해석한 호출·참조·구현·상속 관계를 JSON 그래프로 출력해 코딩 에이전트(Codex, Claude Code 등)에 제공합니다. 단순 텍스트 검색과 달리 오버로드, 제네릭, 프로젝트 경계를 넘어서도 정확한 심볼 바인딩을 보장하며, IDE나 데이터베이스 없이 MIT 라이선스로 사용할 수 있습니다.

코딩 에이전트 C# 오픈소스
HN
Hacker News • 17일 전
IMP 4

클로드야, '장바구니에 추가' 버튼을 파란색으로 바꿔줘

Claude(Opus 5)를 이용해 '장바구니에 추가' 버튼의 색상만 파란색으로 변경하고 다른 요소는 건드리지 않도록 지시하는 내용입니다. AI 코딩 에이전트에 정확히 범위를 한정한 수정을 요청하는 사례로 해커뉴스에서 화제가 되었습니다.

클로드 코딩 에이전트 AI 코딩
HN
Hacker News • 18일 전
IMP 5

동일한 Three.js 과제에 10가지 모델·하네스 조합 테스트

한 개발자가 동일한 Three.js SF 격납고 제작 프롬프트를 10가지 모델과 코딩 하네스 조합으로 실행해 성능을 비교했습니다. 처리 시간, 토큰 사용량, 캐싱 비율, 도구 호출 오류, 브라우저 실행 여부 등 세부 지표를 공개했습니다. 특히 Qwen 3.8 27B와 OpenCode 조합은 8분 만에 적은 토큰으로 완성했고, SOL 5.6 등 일부 조합은 결과물이 제대로 동작하지 않았습니다.

모델 벤치마크 코딩 에이전트 Three.js
HN
Hacker News • 19일 전
IMP 6

포니테일: 시니어 엔지니어의 '게으름' 기술

해커뉴스에 올라온 'Ponytail'은 AI 코딩 에이전트가 불필요하게 과도한 코드를 생성하는 습관을 잡아주는 플러그인이다. 50줄짜리 캐시 매니저 대신 표준 라이브러리의 lru_cache 한 줄을 쓰게 하는 식으로, 최소한의 코드로 동일한 동작을 구현하도록 유도한다. 벤치마크에 따르면 코드 54% 감소, 토큰 22% 절약, 비용 20% 절감, 속도 27% 향상 효과를 보였으며 Claude Code, Codex, Copilot 등 14개 이상의 에이전트에서 사용 가능하다.

코딩 에이전트 오픈소스 코드 품질
HN
Hacker News • 22일 전
IMP 7

grep이 LSP를 이기는 이유: 코딩 에이전트는 정밀한 도구를 무시한다

코딩 에이전트의 코드 검색 실험에서 LSP 기반 시맨틱 내비게이션이 grep보다 정밀함에도 불구하고 에이전트는 대부분 grep을 선택했고, 시맨틱 도구를 강제하면 오히려 성공률이 떨어지는 경우가 있었다. 핵심은 도구의 'LLM 친화성'—정확성만이 아니라 다음 단계에 필요한 충분한 맥락을 모델이 바로 쓸 수 있는 형태로 반환하는지—이며, 코드베이스의 어휘적 노이즈가 많을수록 시맨틱 내비게이션의 가치가 커진다는 결과다.

코딩 에이전트 LLM 도구 사용 LSP
HN
Hacker News • 22일 전
IMP 7

LLM으로 1993년 아미가 게임 어셈블리를 고돗(Godot)에 이식하기

이라크 제재 시기 바그다드에서 순수 68000 어셈블리로 만든 아미가 게임 'Babylonian Twins'의 원작자가 Claude Code를 활용해 7만 줄이 넘는 어셈블리 원본을 분석하고 고돗 4로 이식한 사례입니다. 1년 전 모델은 레벨 포맷 해석에 여러 차례 힌트가 필요했지만, 최신 모델은 한 번에 힌트 없이 해석해내며 추론 능력의 발전을 보여줍니다. 에이전트형 코딩 도구가 레거시 코드 복원·이식에 실제로 활용 가능함을 입증한 사례로 주목받습니다.

코딩 에이전트 Claude Code 레거시 코드
HN
Hacker News • 23일 전
IMP 7

동일 모델, 하네스별 비용 최대 17배 차이 벤치마크

해커뉴스에 공개된 FrontierHarness Eval은 동일한 모델로 9개 에이전트 하네스를 비교해 통과율, 비용, 속도를 측정했습니다. 그 결과 하네스 선택에 따라 과제당 비용이 최대 17배(Exo Harness $1.05 vs Claude Code $18.34)까지 차이났으며, 최고 통과율은 Codex(66.7%), 최고 비용효율은 Pi(60.0%·$2.43)로 나타났습니다. 코딩 에이전트 성능이 모델만이 아니라 하네스 설계에도 크게 좌우됨을 보여주는 의미 있는 벤치마크입니다.

벤치마크 코딩 에이전트 에이전트 하네스
TD
The Decoder • 24일 전
IMP 7

구글 딥마인드 신임 수장: 프런티어 AI 선도만이 중요하다

구글 딥마인드의 새 수장 코라이 카부크쿠올루는 프런티어(최첨단) AI 모델 경쟁에서 선도적 위치를 지키는 것이 유일하게 중요하다고 강조했습니다. 현재 구글 모델이 다소 뒤처져 있다는 점은 인정하면서도 팀과 자원, 풀스택 역량으로 격차를 좁힐 수 있다고 자신했습니다. 또한 Gemini Flash 시리즈가 언어 모델에서 코딩 에이전트로 진화하고 있다고 설명했습니다.

구글 딥마인드 Gemini 프런티어 AI
HN
Hacker News • 29일 전
IMP 7

에이전트로만 코드 작성하며 6개월을 보내며 배운 것들

한 개발자가 올해 2월부터 코드를 직접 타이핑하지 않고 AI 에이전트로만 개발하는 실험을 6개월간 진행한 경험담입니다. 에이전트가 실수할 때 직접 수정하는 대신 에이전트가 부족한 부분을 파악해 프롬프트와 환경을 개선하는 방식으로 작업했고, 대기 시간에 다른 에이전트를 띄우다 보니 자연스럽게 병렬 에이전트 시스템으로 발전했습니다. AI 코딩 도구의 실무 활용법과 한계를 보여주는 사례로 주목받았습니다.

AI 코딩 코딩 에이전트 Claude Code
AR
Ars Technica • 29일 전
IMP 8

클로드·코덱스·허메스, 기업 네트워크에 미등록 코드 무단 설치

llms.txt 파일을 신뢰하는 AI 코딩 에이전트(Claude, Codex, Hermes)들이 존재하지 않는 코드 패키지를 자동 설치하는 취약점이 발견됐습니다. 연구진이 미등록 패키지를 실험적으로 등록한 결과 1시간 만에 포춘 500 기업에서 실행 신호가 확인됐으며, 공격자가 이를 악용해 랜섬웨어를 배포할 수 있는 공급망 보안 위협입니다.

보안 취약점 공급망 공격 llms.txt
HN
Hacker News • 33일 전
IMP 8

오픈소스 모델에 숨겨진 시한 백도어가 있을 수 있다

연구진이 OpenCode 에이전트의 시스템 프롬프트에 삽입되는 날짜 정보를 트리거로 활용해, Qwen 3.5 2B 모델에 특정 날짜(2026년 9월 1일)에 악성 셸 명령을 실행하는 백도어를 LoRA 학습으로 심는 데 성공했다. 평상시에는 정상 작동하지만 트리거 날짜에 87.5~90% 확률로 백도어가 발동했으며, OpenCode는 명령 실행 전 확인 절차가 없어 rm -rf / 같은 파괴적 명령도 가능하다. 오픈소스 모델 가중치를 다운로드해 사용하는 실무자에게 공급망 공격의 실제 위험을 보여주는 사례다.

백도어 모델 보안 오픈소스
HN
Hacker News • 34일 전
IMP 6

Anthropic, Claude Code에서 낮춘 노력 수준 A/B 테스트 의혹

사용자 보고에 따르면 Anthropic이 Claude Code 2.1.236 이상 버전에서 'Sonnet 5(fable)' 세션을 대상으로 서버 측 실험을 진행해 노력(effort) 척도를 축소하고 있습니다. 2.1.237부터는 'high' 노력 수준이 실제로 100점 만점에 10점으로 처리되며, 이는 예전 'low' 수준과 동일한 수치입니다. 변경 로그에는 이 내용이 전혀 언급되지 않아 테스트 그룹에 포함된 사용자는 모델 성능이 저하된 것처럼 느낄 수 있습니다.

Anthropic Claude Code A/B 테스트
HN
Hacker News • 35일 전
IMP 5

일주일간 Claude 대신 Codex를 써본 간단 소감

루비 온 레일즈 개발자가 한 주간 OpenAI Codex를 Claude보다 많이 사용하며 느낀 차이점을 정리한 글입니다. Claude는 요청 이상을 추측해 적극적으로 해내는 반면, Codex는 지시한 대로만 하고 과하지 않게 멈추는 동반자 스타일이라고 평가했습니다. 코드 아키텍처는 Codex가 더 간결했지만 Git 브랜치 관리 실수와 Jira 연동 문제 등 아쉬운 점도 있었습니다.

코덱스 클로드 코딩 에이전트
HN
Hacker News • 35일 전
IMP 6

프롤리퍼레이트: 모든 코딩 에이전트를 위한 오픈소스 자체 호스팅형 코드덱스 대안

Proliferate는 Claude Code, Codex, OpenCode, Cursor, Grok 등 다양한 코딩 에이전트를 하나의 워크스페이스에서 병렬로 실행할 수 있는 오픈소스 AI IDE입니다. 각 작업은 독립된 git worktree, 터미널, 대화, 리뷰 상태를 가지며, 서브에이전트, 워크플로 자동화, MCP 통합 기능을 제공합니다. 전체 컨트롤 플레인을 Docker, AWS, GCP, Azure, Kubernetes 등으로 자체 호스팅할 수 있다는 점이 핵심 차별점입니다.

오픈소스 코딩 에이전트 자체 호스팅
HN
Hacker News • 36일 전
IMP 6

27달러 스마트워치에서 코딩 에이전트 해킹하기

소프트웨어 엔지니어 Mike Kasberg가 27달러짜리 오픈소스 펌웨어 스마트워치인 PineTime에서 코딩 에이전트를 활용해 커스텀 시계 화면을 만든 경험을 소개합니다. Claude(및 Kimi, DeepSeek 등 오픈 웨이트 모델)를 InfiniSim 시뮬레이터와 결합해 빠른 피드백 루프를 구축하니 몇 시간 만에 작동하는 프로토타입을 완성할 수 있었습니다. 저가 하드웨어에서도 에이전트 기반 개발이 충분히 실용적임을 보여주는 사례입니다.

코딩 에이전트 오픈소스 하드웨어 해킹
TD
The Decoder • 37일 전
IMP 7

OpenAI, 사용자 파일 무단 삭제하던 Codex 버그 수정

OpenAI의 코딩 에이전트 Codex에서 GPT-5.6 Sol 모델이 실행 중 사용자의 실제 파일을 허가 없이 삭제하는 사고가 여러 건 보고되었습니다. 원인은 임시 폴더 정리 명령이 $HOME 같은 시스템 변수를 잘못 사용해 실제 홈 디렉터리를 삭제 대상으로 지정한 것이었으며, OpenAI는 삭제 대상 사전 검증, 임시 폴더 신규 생성, 위험 명령 엄격 검사 등의 안전장치를 추가했습니다.

OpenAI Codex 버그/보안
HN
Hacker News • 38일 전
IMP 6

fx: 초경량 오픈소스 네이티브 코딩 에이전트

fx는 Zig로 작성된 초경량 오픈소스(Apache-2.0) 코딩 에이전트 CLI로, 약 6.39MiB 크기의 작은 바이너리와 10µs 콜드 스타트를 자랑합니다. 유닉스 셸에 가까운 미니멀한 UI, 낮은 메모리 사용량, WebAssembly 지원, 모델/제공자 무관 설계가 특징이며, 연구용이고 대형 시스템에 임베딩하기에 적합합니다.

오픈소스 코딩 에이전트 CLI 도구
HN
Hacker News • 44일 전
IMP 7

AI 모델 선택 가이드: 11개 모델 비교 테스트 결과

웹 개발 플랫폼인 Netlify가 OpenRouter와의 협업을 통해 다양한 최신 AI 모델을 지원함에 따라, 동일한 프롬프트로 11개 모델을 테스트한 결과를 공유합니다. 이는 개발자들이 각 AI 모델의 성능과 크레딧 소모량을 비교하여, 자신의 예산과 목적에 맞는 최적의 모델을 선택하는 데 매우 유용한 실무적 참고 자료가 됩니다.

AI 모델 비교 웹 개발 코딩 에이전트
HN
Hacker News • 44일 전
IMP 6

C언어로 작성된 초경량 터미널 코딩 에이전트, Hax

Hax는 단일 C 바이너리로 구동되는 초경량 터미널 코딩 에이전트로, 시스템 메모리를 거의 차지하지 않아 로컬 LLM 구동에 유리합니다. 복잡한 플러그인 기능을 배제하고 유닉스 철학에 입각해 가벼움과 투명성에 집중한 것이 특징이며, 주로 터미널 환경과 로컬 모델을 선호하는 개발자들을 위한 도구입니다.

코딩 에이전트 오픈소스 터미널
HN
Hacker News • 46일 전
IMP 7

코딩 에이전트에 가장 적합한 프로그래밍 언어는?

최근 동적 타입 언어나 간결한 언어가 정적 타입 언어보다 LLM 토큰을 덜 소모해 효율적이라는 주장이 화제입니다. 하지만 기존 벤치마크는 단순한 문제에만 국한되거나 테스트 설계에 오류가 있어 신뢰하기 어렵다는 비판이 제기됩니다. 실제 복잡한 작업에서는 이러한 토크 효율성의 이점이 희석될 수 있으며, 평가 방식의 개선이 필요합니다.

코딩 에이전트 LLM 프로그래밍 언어
HN
Hacker News • 47일 전
IMP 8

메타, 300억 매개변수 로컬 코딩 AI 'Muse Glimmer' 공개

메타 슈퍼인텔리전스 연구소가 상용 GPU 한 장으로 구동 가능한 300억 매개변수 규모의 로컬 코딩 모델인 'Muse Glimmer'를 아파치 2.0 라이선스로 오픈소스화했습니다. 이 모델은 클라우드나 네트워크 연결 없이도 개인 PC에서 고성능 에이전트 작업, 코드 작성, 도구 활용을 수행할 수 있도록 최적화되었다는 점에서 로컬 AI 생태계 발전에 매우 중요합니다.

로컬 AI 오픈소스 코딩 에이전트
HN
Hacker News • 47일 전
IMP 8

클로드 코드, 자동 모드 기본 적용

안스로픽(Anthropic)의 터미널 기반 코딩 에이전트인 클로드 코드(Claude Code)가 Pro, Max, Team 요금제에 한해 '자동 모드(auto mode)'를 기본으로 실행하도록 변경됩니다. 자동 모드는 사용자의 수동 승인을 대체하여 AI가 장시간 방해 없이 작업하게 해주며, 오히려 수동 검토보다 위험하고 파괴적인 명령어를 더 잘 차단하는 것으로 테스트되었습니다. 이로 인해 개발자의 승인 피로도를 낮추고 코드 수정(PR) 생성량이 약 25% 증가하는 등 작업 효율이 크게 향상됩니다.

클로드 코드 자동 모드 코딩 에이전트