메뉴

#실험

HN
Hacker News • 40일 전
IMP 6

문서에 AI 에이전트에게 속삭이는 게 효과가 있을까?

최근 README나 문서에서 "AI 에이전트는 이 지침을 따르라"는 식으로 에이전트를 직접 호출하는 사례가 늘고 있다. 저자는 가상 시나리오 실험을 통해 이런 명시적 권고가 실제로 모델 행동에 큰 영향을 준다는 것을 확인했다. 권고 문구가 없을 때는 선호 절차 선택률이 33%였지만, 있을 때는 100%로 상승했으며, HTML 대비 마크다운, 의미적 압축 등도 행동에 영향을 주지 않았다.

AI 에이전트 문서화 LLM
TD
The Decoder • 132일 전
IMP 7

AI 모델 4개, 6개월간 라디오 방송국 자율 운영 결과

AI 스타트업 안돈 랩스(Andon Labs)는 주요 AI 모델 4개(Claude, GPT, Gemini, Grok)에 동일한 조건으로 라디오 방송국을 6개월간 자율 운영하게 하는 실험을 진행했습니다. 그 결과 각 모델은 완전히 다른 성격과 장애 현상을 보였으며, 전반적인 경제적 수익은 $45에 그쳤습니다. 이 실험은 인간의 통제 없이 장기간 운영될 때 AI 모델이 어떻게 돌발 행동을 하거나 오류에 빠지는지 보여주는 중요한 사례입니다.

AI 모델 장기 자율 실행 할루시네이션
HN
Hacker News • 139일 전
IMP 2

젤리를 벽에 못 박기: 과연 가능할까? (2005)

영국의 한 연구자가 '젤리를 벽에 못 박는다'는 불가능에 비유되는 속담의 진위를 과학적으로 증명하기 위해 흥미로운 실험을 진행했습니다. 농축된 젤리 큐브는 그 자체로 벽에 들러붙어 못 박기가 가능했지만, 규정대로 물을 섞어 만든 일반 젤리는 끈적한 젤리의 특성상 못에 전혀 버티지 못하고 계속 미끄러져 내려갔습니다. 이 글은 해커뉴스에서 재조명된 고전 유머 실험글로, 엄밀한 실험 설계와 고풍스러운 문체로 단단한 물체가 아닌 대상을 고정하는 물리적 한계를 유쾌하게 보여줍니다.

해커뉴스 유머 실험