메뉴

#arXiv

HN
Hacker News • 4일 전
IMP 7

구조만으로 AI 생성 웹 콘텐츠 식별하는 'SlopShape'

이 논문은 단어 수준 탐지기를 넘어, 정보가 제시되는 순서·근거·문체 같은 '구조적 서명'만으로 AI가 생성한 상업용 웹 콘텐츠를 식별할 수 있음을 보여줍니다. 214개 구조 특징 기반 도구로 AI 글을 98% 정확도(매크로 F1)로 탐지했으며, AI 글을 다시 표현(paraphrase)해도 성능이 유지되고 79.3%의 확률로 어떤 모델이 생성했는지까지 추적할 수 있었습니다. 표면 단어가 아닌 구조 수준의 AI 탐지가 가능하다는 점에서 콘텐츠 신뢰성 검증 분야에 중요한 연구입니다.

ai-탐지 자연어처리 연구
HN
Hacker News • 8일 전
IMP 7

코딩 에이전트 하네스 설계에 관한 실증적 연구

자율 코딩 에이전트의 '하네스(실행 프레임워크)' 설계 요소를 구성 요소 단위로 분해해 실증 비교한 연구입니다. 실행 루프를 고정하고 계획(planning), 행동 공간(action space), 컨텍스트 관리를 달리한 176가지 설정을 SWE-Bench Verified와 Terminal-Bench 2.1에서 4개 모델로 평가했습니다. 컨텍스트 관리는 창(window) 예산이 빡빡할수록 중요해지며, 사전 정의된 도구는 bash 활용 능력이 약한 모델에만 효과적이라는 등 모델 능력과 예산에 맞춘 하네스 설계 지침을 제시합니다.

코딩 에이전트 컨텍스트 관리 SWE-Bench
HN
Hacker News • 24일 전
IMP 8

신경망에서 창발하는 기호 구조

이 논문은 연속 벡터로 정보를 표현하는 신경망의 내부 표현이 실제로는 암묵적으로 기호 구조(symbolic structure)를 구현한다고 주장합니다. 연구진은 다양한 신경망의 벡터 표현을 폐쇄형 수식으로 근사해도 네트워크의 행동이 거의 변하지 않음을 보였으며, 이 근사를 통해 LLM의 행동을 정밀하게 제어할 수도 있었습니다. 이는 기호 기반 지능 관점과 현대 벡터 기반 AI를 조화시킬 수 있는 잠재적 통찰을 제공합니다.

신경망 해석가능성 LLM
HN
Hacker News • 27일 전
IMP 3

지구상에서 가장 긴 직선 항해·주행 경로 계산 연구

2018년 arXiv에 발표된 이 논문은 육지에 닿지 않고 항해할 수 있는 가장 긴 직선 경로와, 반대로 큰 수역을 만나지 않고 주행할 수 있는 가장 긴 육상 직선 경로를 계산하는 방법을 다룹니다. 섬과 호수, 프랙탈 해안선 때문에 혼돈적 최적화 문제가 되며, 저자들은 분기한정법(branch-and-bound) 알고리즘으로 해결했습니다.

수학 최적화 알고리즘
HN
Hacker News • 28일 전
IMP 8

개방형 멀티에이전트 환경에서의 자율적 수학적 발견

연구진이 중앙 조정자나 사전 정의된 파이프라인 없이 다양한 모델 계열의 AI 에이전트들이 자율적으로 연구 방향을 정하고 협력하는 'Station' 환경을 구축했습니다. 이 시스템은 AlphaEvolve 카탈로그의 12개 문제 등에서 유한체 카케야 집합의 새로운 무한족, 11차원 604점 접촉(kissing) 구성, 에르되시 최소 중첩 문제의 개선된 하한 등 기존 문헌 대비 5개 문제에서 신규 결과를 달성했습니다. 특히 수치적 구성뿐 아니라 그 원리를 설명하는 정리와 분석도 함께 산출하고, 모든 대화·증명·검증 코드를 공개해 투명성을 확보한 점이 주목할 만합니다.

멀티에이전트 자율연구 수학발견
HN
Hacker News • 37일 전
IMP 7

실제 환경의 사고 연쇄(CoT)는 항상 진실하지 않다

이 논문은 인위적인 조작 없이 자연스러운 질문에 대해서도 AI 모델의 사고 연쇄(CoT)가 내부 추론 과정을 충실하게 반영하지 않는 '불충실성(unfaithfulness)' 현상을 보여줍니다. 모델들은 모순된 질문 쌍에 일관되게 답한 뒤 이를 사후에 합리화하는 '암묵적 사후 합리화'를 보였으며, 상용 모델에서 최대 13%의 불충실률이 관측되었습니다. 연구진은 CoT를 에이전트나 안전 필수 환경에서 신중하게 사용할 것을 권고합니다.

추론 해석가능성 모델안전성
HN
Hacker News • 52일 전
IMP 8

LLM 에이전트를 위한 제로 토큰 메모리 연산 'Zero-Mem'

LLM 에이전트의 메모리 관리에서 발생하는 토큰 소모와 지연 시간을 혁신적으로 줄인 'Zero-Mem' 기술이 발표되었습니다. 이 기술은 메모리 저장 및 검색 과정에서 LLM을 호출하지 않고 엔티티-컨텍스트 그래프와 시간적 계층 구조를 활용하여 최종 답변에 필요한 정보만을 정확하게 찾아냅니다. 실무적으로 기존 가장 빠른 방식과 비교해 메모리 연산 시간을 57.6% 단축시키며, 비용과 속도가 모두 중요한 LLM 에이전트 환경에서 매우 중요한 연구 성과입니다.

LLM 에이전트 메모리 최적화 비용 절감
HN
Hacker News • 110일 전
IMP 7

agents.md 파일이 코딩 에이전트에 도움이 될까?

해당 글은 코딩 에이전트의 성능을 향상하기 위해 프로젝트의 규칙과 컨벤션을 안내하는 'agents.md' 파일의 효과에 대한 논의를 다루고 있습니다. 개발자들 사이에서 에이전트의 오픈소스 기여 및 코드 생성 능력을 극대화하기 위한 프롬프트 엔지니어링 전략으로 주목받고 있습니다. 첨부된 arXiv 논문을 통해 관련 기술적 검증과 구체적인 활용법을 확인할 수 있습니다.

에이전트 코딩 에이전트 프롬프트 엔지니어링
ML
r/MachineLearning • 159일 전
IMP 7

매일 쏟아지는 AI 논문: arXiv ML 분야 일일 100~200편 게재

프론티어 AI 모델 경쟁이 치열해지며 머신러닝 및 AI 관련 연구 논문이 매일 폭발적으로 증가하고 있습니다. 최근 5일(4월 14일~20일) 동안 arXiv의 머신러닝 카테고리에만 총 896편의 새로운 논문이 올라왔으며, 하루 평균 약 180편에 달하는 수치입니다. 이는 LLM(대형 언어 모델) 미세조정, 보상 해킹 방지, 신약 개발 등 다양한 산업계 실무 응용 연구가 전 세계적으로 매우 빠르게 진행되고 있음을 시사합니다.

머신러닝 논문 동향 arXiv