이 보고서를 보는 방법

각 섹션은 독립적으로 읽을 수 있고, 노트 이름 (예: differential_sharpe_moody2001) 이나 노트 칩 을 클릭하면 모달에서 풀텍스트가 열립니다. 그래프 노드도 클릭 가능합니다.

핵심 RQ (현재): "BTC 그리드 트레이딩에서 reward 설계가 RL 정책의 알파에 어떤 영향을 미치는가? 특히, 어떤 reward 함수 하에서 RL 이 ATR 규칙 기반을 초과하며 (혹은 초과하지 못하며), 그 메커니즘은 무엇인가?"

현재 위치: Phase 3 진행 중. exp032b → 시나리오 D (Pareto frontier) 확정. exp032c (mechanism) + exp033 (slippage) 완료. 다음 exp034 (CPCV+DSR).

1. RQ 진화 — 왜, 어떻게 바꿨나

자료 조사와 실험 결과가 어떻게 RQ 를 다시 정의하게 만들었는지의 시간순 기록. ● Pivot / ● Discovery / ● Fix / ● Refine / ● Current

2. 인터랙티브 지식 지도

27개 학습 노트 (원형) ↔ 8개 실험 (사각형) 의 의존 관계. Bundle 필터로 카테고리별 강조 가능. 노드를 클릭하면 노트 본문 또는 실험 상세가 열립니다.

완료 실험
대기 실험
폐기 실험
A 직결
B 이론
C 그리드뿌리
D 보강
E 정합성

3. 실험 설계 카드 (exp030~035)

각 카드는 "무엇을 / 어떻게 / 무엇이 나왔는가 / 어떤 자료 기반인가" 의 4-tuple. 노트 칩 클릭 시 본문 열림.

4. 가설 × 실험 매트릭스

H1~H4 가설이 어느 실험에서 어떻게 (부분) 지지/부정되었는가.

5. 자료 분류 — 무엇이 직결, 무엇이 배경인가

27개 노트의 5개 Bundle 분류. 노트 클릭 시 본문 열림.

6. 외부 참조 — 배경 지식 (실험 설계에 직접 미사용)

퀀트 투자 일반, López de Prado · Ernie Chan 등 책. 본 실험 설계에 직접 들어가진 않았으나 토대 지식.

7. 남은 작업 + 미해결 질문

중간 보고서 시점에서 명시적으로 짚어둔 오픈 이슈.

다음 실험 (시간순)

  1. exp034 — CPCV 6-fold + DSR: Train+Val 안에서 path 분포로 다중검정 보정된 진짜 알파 검증. (§7.2)
  2. exp035 — Test set 봉인 해제: CPCV 통과 후 1회 평가. (§7.3 최종)
  3. 논문 본문 작성 병행.

미해결 / 오픈 질문

  • exp027_rl 의 Env-v3 사전 증거 (Test Sharpe 1.955, ATR +109%) 가 Env-v4 에서는 +12% 로 약화. 환경 의존성 효과가 reward variant 효과보다 큰 것 의 §8 Discussion 정직 인정.
  • H2-strong (variant > sym) 의 부분 부정 — exp032b 에서 sym 이 Sharpe 1위. dsr 만 sym 과 동등. asym/pt 는 sym 보다 낮음. 단일 winner 없는 결과의 thesis statement 정교화 필요.
  • exp031 BC warm-start 의 학습 정체 — 정석 BC pretrain 또는 SAC 전환은 future work.
  • 호가창 모델링 부재. 본 논문 §7 한계 명시.