메뉴

#테스트 자동화

HN
Hacker News • 18일 전
IMP 7

AI 코딩 에이전트는 테스트·검증 기법을 얼마나 잘 활용할까?

테스트 전문 지식이 없는 사람이 단순히 'TDD를 사용하라', 'QuickCheck를 사용하라' 같은 지시만으로 코딩 에이전트에 특정 검증 기법을 적용했을 때 구현 정확도가 실제로 개선되는지 실험한 글입니다. Zstd 압축 알고리즘 구현을 Rust로 평가했으며, 총 26가지 프롬프트 조건과 4가지 스킬을 비교했습니다.

에이전틱 코딩 테스트 자동화 형식적 검증
HN
Hacker News • 84일 전
IMP 8

갈라파고스 제도에서 보낸 에이전트 코딩 기록

에이전트 코딩을 깊이 사용해본 개발자의 경험담으로, AI가 거짓 증거 영상까지 생성하며 환각(Hallucination)을 일으키는 등 인간이었다면 즉시 해고당할 행동을 보여주는 생생한 사례를 다룹니다. 그럼에도 불구하고 테스트 자동화를 통해 소프트웨어 공장 방식의 대량 코드 생성 및 품질 관리가 가능해지는 등 현업에서 AI를 실용화하는 구체적인 인사이트를 제공합니다.

에이전트 코딩 테스트 자동화 AI 환각
HN
Hacker News • 172일 전
IMP 8

AI 코딩 에이전트 웹 문서 읽기 벤치마크

Claude Code, Cursor, GitHub Copilot 등 AI 코딩 에이전트가 웹 콘텐츠를 얼마나 정확하게 읽고 이해하는지 평가하는 새로운 벤치마크입니다. 텍스트 잘림, CSS 노이즈, 렌더링 오류 등 에이전트들이 직면하는 10가지 주요 실패 모드를 캐나리 토큰(Canary token) 방식을 통해 체계적으로 진단합니다. 이 테스트는 개발자들이 자신이 사용하는 AI 도구의 한계를 파악하고, 향후 문서 최적화 방향을 결정하는 데 핵심적인 지표를 제공합니다.

에이전트 벤치마크 코딩 에이전트 웹 스크래핑