메뉴
HN
Hacker News • 52일 전

와이콤비네이터 S26, LLM 퀀트 트레이딩 학습 환경 공개

IMP
7/10
핵심 요약

와이콤비네이터(YC) S26 기의 스타트업 EdotEnv는 실제 시장 데이터를 기반으로 강화학습(RL) 환경을 구축하여 LLM 에이전트에게 퀀트 리서치 및 장기적 트레이딩 계획을 수립하도록 훈련시킵니다. 기존의 정적인 벤치마크와 달리 시장은 포화 상태에 이르지 않고 스스로 더 어려워지기 때문에, AI 모델이 지속적으로 발전하고 적응할 수 있는 최적의 학습 환경을 제공한다는 점이 핵심입니다.

번역된 본문

콘텐츠 건너뛰기 0 1 소개 0 2 왜 시장인가? 0 3 팀 0 4 블로그 0 5 뉴스

시장 미시구조 정책 롤아웃 / 096시간 시장 상태 정책 πθ(a|s) 지연된 보상

강화학습 환경 (Reinforcement learning environments) 우리는 에이전트에게 실전 머신러닝(ML)과 대립적 노이즈 하에서의 장기적 계획 수립을 가르치기 위해 시장 데이터 기반의 강화학습 환경을 구축합니다. 정적인 합성 벤치마크는 비현실적이며 빠르게 한계에 도달하지만, 시장은 한계에 도달하지 않고 스스로 개선되는 특성을 가집니다. 대기열 참여 ↗ 논문 읽기 ↓

본질적인 비정상성 (NONSTATIONARY BY DESIGN) 리셋 없음 / 포화 없음 (NO RESET / NO SATURATION) 시장 파생 / 연구 중심 (MARKET-DERIVED / RESEARCH-FOCUSED)

논지 (THESIS) 정적인 세계는 정적인 지능을 낳습니다. 퀀트(Quant)는 가장 어렵지만 해결 가능한 데이터 과학 과제입니다. 우리는 실제 시장 데이터로 구축된 환경 내에서 퀀트 리서치 과제를 프로그래밍 방식으로 생성합니다. 에이전트는 전문 도구를 사용하거나 Bash를 통해 자체 도구를 구축하여 트레이딩 결정을 내리고 수익성 있는 전략을 개발합니다. 시장은 포화 상태에 이르지 않습니다. 성공적인 트레이딩은 시장을 더욱 효율적으로 만들고, 반면 기존의 우위는 감소하며 시장 국면은 변동하기 때문입니다. 이러한 이유로 우리의 환경은 모델을 지속적으로 개선할 수 있는, 끊임없이 난이도가 높아지는 벤치마크 역할을 합니다.

지평 (HORIZON) 결정은 단 한 순간이 아닙니다. 트레이딩 결정은 하나의 미래 단계 이상에 영향을 미칩니다. 성공적인 트레이딩은 여러 단계를 내다보고 계획하며, 단기적 이익과 장기적 이익 사이의 트레이드오프를 평가하는 것을 의미합니다.

T+00 선택 (Choose): 불완전한 정보 하에서 행동합니다. 모델은 불완전한 상태를 관찰하고, 모든 결과가 확인되기 전에 결정을 확정합니다.

T+18H 복리 효과 (Compound): 결정은 환경의 일부가 됩니다. 노출, 기회비용 그리고 취하지 않은 모든 행동이 이어지는 경로를 새롭게 형성합니다.

T+53H 재평가 (Revalue): 목표가 이동합니다. 상황이 변화함에 따라 국소적으로는 올바른 결정이 전역적으로는 비용이 많이 드는 결정이 될 수 있습니다.

T+96H 적응 (Adapt): 이전에 유효했던 정책은 만료됩니다. 성공은 어제의 행동이 합의된 통념이 되기 전에 새로운 시장 국면을 가장 먼저 인식하는 모델의 몫입니다.

원문 보기
원문 보기 (영어)
Skip to content 0 1 About 0 2 Why Markets 0 3 Team 0 4 Blog 0 5 News MARKET MICROSTRUCTURE POLICY ROLLOUT / 096H MARKET STATE POLICY πθ(a|s) DELAYED REWARD Reinforcement learning environments We build market-derived RL environments to teach agents applied ML and long-horizon planning under adversarial noise. Static synthetic benchmarks are unrealistic and saturate quickly, whereas markets are non-saturating and self-improving. Join waitlist ↗ Read the thesis ↓ NONSTATIONARY BY DESIGN NO RESET / NO SATURATION MARKET-DERIVED / RESEARCH-FOCUSED THESIS Static worlds produce static intelligence Quant is the hardest, yet solveable data science task. We programmatically generate quant research tasks inside environments built from real market data. Agents use professional tools—and build their own in Bash—to make trading decisions and develop profitable strategies. Markets do not saturate: successful trading makes them more efficient, while edges decay and regimes shift. That makes our environments a continuously harder benchmark for improving models. HORIZON A decision is not a moment Trading decisions affect more than one future step. Trading successfully means planning ahead multiple steps and assess trade-offs between short and longterm gains T+00 T+96H T+00 Choose Act under partial information. The model sees an incomplete state and commits before the full consequences are observable. T+18H Compound The decision becomes part of the environment. Exposure, opportunity cost and every action not taken reshape the path that follows. T+53H Revalue The objective moves. A decision can remain locally correct while becoming globally expensive as conditions drift. T+96H Adapt The policy that worked has expired. Success belongs to the model that recognizes the new regime before yesterday’s behavior becomes consensus.