이 보고서를 보는 방법
각 섹션은 독립적으로 읽을 수 있고, 노트 이름 (예: differential_sharpe_moody2001) 이나
노트 칩 을 클릭하면 모달에서 풀텍스트가 열립니다.
그래프 노드도 클릭 가능합니다.
핵심 RQ (현재):
"BTC 그리드 트레이딩에서 reward 설계가 RL 정책의 알파에 어떤 영향을 미치는가?
특히, 어떤 reward 함수 하에서 RL 이 ATR 규칙 기반을 초과하며 (혹은 초과하지 못하며), 그 메커니즘은 무엇인가?"
현재 위치: Phase 3 진행 중. exp032b → 시나리오 D (Pareto frontier) 확정. exp032c (mechanism) + exp033 (slippage) 완료. 다음 exp034 (CPCV+DSR).
1. RQ 진화 — 왜, 어떻게 바꿨나
자료 조사와 실험 결과가 어떻게 RQ 를 다시 정의하게 만들었는지의 시간순 기록.
● Pivot /
● Discovery /
● Fix /
● Refine /
● Current
2. 인터랙티브 지식 지도
27개 학습 노트 (원형) ↔ 8개 실험 (사각형) 의 의존 관계. Bundle 필터로 카테고리별 강조 가능.
노드를 클릭하면 노트 본문 또는 실험 상세가 열립니다.
3. 실험 설계 카드 (exp030~035)
각 카드는 "무엇을 / 어떻게 / 무엇이 나왔는가 / 어떤 자료 기반인가" 의 4-tuple. 노트 칩 클릭 시 본문 열림.
4. 가설 × 실험 매트릭스
H1~H4 가설이 어느 실험에서 어떻게 (부분) 지지/부정되었는가.
5. 자료 분류 — 무엇이 직결, 무엇이 배경인가
27개 노트의 5개 Bundle 분류. 노트 클릭 시 본문 열림.
6. 외부 참조 — 배경 지식 (실험 설계에 직접 미사용)
퀀트 투자 일반, López de Prado · Ernie Chan 등 책. 본 실험 설계에 직접 들어가진 않았으나 토대 지식.
7. 남은 작업 + 미해결 질문
중간 보고서 시점에서 명시적으로 짚어둔 오픈 이슈.
다음 실험 (시간순)
- exp034 — CPCV 6-fold + DSR: Train+Val 안에서 path 분포로 다중검정 보정된 진짜 알파 검증. (§7.2)
- exp035 — Test set 봉인 해제: CPCV 통과 후 1회 평가. (§7.3 최종)
- 논문 본문 작성 병행.
미해결 / 오픈 질문
- exp027_rl 의 Env-v3 사전 증거 (Test Sharpe 1.955, ATR +109%) 가 Env-v4 에서는 +12% 로 약화. 환경 의존성 효과가 reward variant 효과보다 큰 것 의 §8 Discussion 정직 인정.
- H2-strong (variant > sym) 의 부분 부정 — exp032b 에서 sym 이 Sharpe 1위. dsr 만 sym 과 동등. asym/pt 는 sym 보다 낮음. 단일 winner 없는 결과의 thesis statement 정교화 필요.
- exp031 BC warm-start 의 학습 정체 — 정석 BC pretrain 또는 SAC 전환은 future work.
- 호가창 모델링 부재. 본 논문 §7 한계 명시.