작성: 2026-05-14. 본 문서가 프로젝트의 단일 기준점이다. ROADMAP, CLAUDE.md, RESEARCH_LOG, project_continuation_plan은 모두 이 문서에 정렬되어야 한다.
BTC 그리드 트레이딩에서 reward 설계가 RL 정책의 알파에 어떤 영향을 미치는가? 특히, 어떤 reward 함수 하에서 RL이 ATR 규칙 기반을 초과하며 (혹은 초과하지 못하며), 그 메커니즘은 무엇인가?
부 질문:
⚠️ RQ 표현 원칙: RQ는 열린 질문 형태로 유지한다. 사전 증거가 강하더라도(exp027_rl 등) 그 증거는 가설(H1~H4) 의 정당성으로 흡수하지 RQ의 답으로 단정하지 않는다. Thesis statement (“Reward 설계가 RL 알파의 핵심 채널이다”) 는 결과가 가설을 지지할 때 §5 Positive finding과 abstract/conclusion에서 사용한다.
BTC/USDT 1시간봉 단일 자산.
자산 확장은 본 졸업 논문 범위에서 명시적으로 제외한다.
H1: Symmetric reward + ATR 비례 공식의 조합에서, RL의 자유도(state 인식 + 적응 행동)는 ATR이 이미 흡수한 변동성 차원의 알파를 넘어서지 못한다.
H2: 손실에 비대칭 가중을 주거나(Asymmetric, Prospect-theoretic), 위험조정수익을 직접 reward로 정의하면(DSR), RL이 ATR의 한계를 초과한다.
H3: 그 초과는 행동 측면에서 “선택적 진입” (낮은 거래 빈도 + 높은 사이클 승률)으로 나타난다.
근거 (사전 증거):
→ H1, H2, H3는 사전 부분 증거가 있으나 정식 검증 필요.
본 논문은 결과가 아래 어느 시나리오로 나오든 작성 가능한 RQ 구조를 채택. 사전에 4개 시나리오를 명시 등재하여 ex-post rationalization 을 회피한다.
근거 (exp032b, 40 runs × 1M steps, 2026-05-15):
| Variant | Best Sharpe | MDD% | Calmar | Cluster |
|---|---|---|---|---|
| sym | 1.871 ± 0.22 | 3.27 | 0.60 | aggressive |
| dsr | 1.809 ± 0.21 | 4.33 | 0.47 | aggressive |
| asym | 1.681 ± 0.10 | 2.28 | 0.755 | conservative |
| pt | 1.667 ± 0.09 | 2.31 | 0.735 | conservative |
| ATR | 1.378 | 9.83 | 0.153 | — |
| 그룹 내 | Cohen’s d | < 0.30 / 그룹 간 > 0.79 → 두 cluster 통계적 분리 |
가설 H1~H4 점검: | 가설 | 결과 | 근거 | |—|—|—| | H1 (sym ≈ ATR) | 부정 | sym best 1.871 » ATR 1.378 | | H2 weak (variant > ATR) | 지지 | 4 모두 ATR 초과 | | H2 strong (variant > sym) | 부분 부정 | dsr ≈ sym, asym/pt < sym | | H3 (selective entry) | 지지 | asym/pt 거래 ~75% of sym | | H4 (CPCV+Slippage robust) | 검증 예정 | exp033/034 |
exp027_rl 사전 증거의 환경 의존성 인정:
본 논문 §5 메인 thesis (시나리오 D 위에서):
“Reward variant 의 영향은 단일 metric (Sharpe) 의 alpha source 가 아니라, risk profile dimension 의 trade-off 로 나타난다. 4 variant 는 두 cluster (aggressive vs conservative) 로 통계적으로 분리되며, Sharpe-MDD 평면에서 Pareto-like frontier 를 형성한다. 단순 ‘X reward 가 best alpha’ 결론보다 multi-dimensional trade-off 의 정직한 정량화가 본 논문의 contribution 이다.”
→ §5 는 “Pareto frontier discovery” 로, §6 (exp032c mechanism) 은 “왜 두 cluster?” 메커니즘 정량화로, §8 Discussion 은 exp027_rl 의 환경 의존성 정직 인정으로 구성.
Reward variant × 평가 path 의 2D 매트릭스. variant별 분포 비교.
| 코드 | 정식명 | 학술 출처 |
|—|—|—|
| sym | Symmetric equity change | Baseline (현재 r_step) |
| asym | Asymmetric (loss penalty β) | exp027_rl, Prospect Theory 단순화 |
| dsr | Differential Sharpe Ratio | Moody & Saffell (2001) |
| pt | Prospect-theoretic (α, λ) | Kahneman & Tversky (1979) |
1. Introduction
- Grid trading + RL의 자연스러운 만남
- ATR 비례 공식의 변동성 흡수 가설
- 본 논문의 contribution: reward design이 RL 알파의 핵심 채널
2. Background
- Grid trading의 학술적 위치 (Avellaneda-Stoikov 2008)
- DRL trading (Zhang Zohren Roberts 2020, Gort 2022)
- Reward design 이론 (Moody 2001, Ng 1999, Kahneman 1979)
3. Method
- 환경 설계 (MDP, 4-order grid, n_splits 사이클)
- ATR 비례 공식 (Bayesian-optimized baseline)
- RL 알고리즘 (PPO + BC warm-start)
- 4가지 Reward 변형
4. Negative finding (RQ-1)
- Symmetric reward 하에서 RL ≈ ATR (exp020~022, exp026 재실험)
5. Positive finding (RQ-2) — 메인 챕터
- 4가지 reward 비교 (exp032 메인 결과)
- CPCV 분포 (exp034)
- DSR 통계 검증
6. Mechanism (RQ-3)
- Regime별 행동 분석 (Bull/Bear/Sideways)
- 사이클 통계 비교 (거래 빈도, 승률, PnL)
- 정책 포화 vs 선택적 진입의 행동 패턴
7. Robustness (RQ-4)
- Slippage + Domain Randomization (exp033)
- Test set 평가 (exp035)
- 한계 (BTC 단일 자산, 1시간봉, 호가창 미모델링)
8. Discussion
- Reward design이 알파 채널인 이유
- 자산 확장 시사점 (실제 확장은 본 논문 외)
- 라이브 트레이딩 (Sim2Real gap)
9. Conclusion
| Exp | 논문 챕터 | 목적 |
|---|---|---|
| exp030 | Method (3.3 학습 안정화) | PPO 학습 안정화 패키지 |
| exp031 | Method (3.4 출발선 보장) | BC warm-start로 학습 초반 낭비 회피 |
| exp031b | Method (조건부) | exp031 부족 시 CQL + mixed dataset |
| exp032a | Method (3.5 공정 비교) | Variant별 reward hyperparameter 튜닝 |
| exp032b | Positive finding (5장 메인) | 4 variant full 비교 + effect size |
| exp032c | Mechanism (6장) | counterfactual + SHAP + mediation |
| exp033 | Robustness (7.1) | Slippage + Domain Randomization |
| exp034 | Positive finding (5장) + Robustness (7.2) | CPCV 분포 + DSR |
| exp035 | Robustness (7.3 최종 검증) | Test set 봉인 해제 |
기존 exp001~029의 결과는 RQ-1의 negative finding 근거 + RQ-2의 가설 시발점으로 활용. 이미 한 작업이지 새로 할 필요 없음. RESEARCH_LOG에 정리되어 있음.
본 문서가 명시한 RQ에서 벗어나는 모든 작업을 본 논문 범위 외로 처리.
| 날짜 | 변경 | 근거 |
|---|---|---|
| 2026-05-14 (1차) | 본 문서 신설. RQ를 “RL이 고정 그리드 대비 우위?”에서 “Reward design이 RL 알파의 핵심 채널?” (단정문) 로 전환. 자산 확장 제외 결정. | 사용자와 합의 (2026-05-14 대화) |
| 2026-05-14 (2차) | RQ를 단정문 → 열린 질문 형태로 수정. 사전 증거(exp027_rl)는 가설 H1~H4의 정당성으로 유지하되, RQ 자체는 검증 결과에 따라 어느 쪽이든 살아남는 형태로. | 학술 컨벤션 준수 + 확증 편향 회피. 사용자 지적으로 수정. |
| 2026-05-15 | 결과 시나리오 분기 섹션 신설. 사전 시나리오 A/B/C 등재 + exp032b 본 검증 결과 시나리오 D (Pareto frontier) 사후 추가 + 현재 확정 시나리오 = D. 본 논문 §5 메인 thesis 갱신. | exp032b 결과 (40 runs × 1M, 두 cluster 발견). 시나리오 A 사전 증거 (exp027_rl Env-v3) 의 환경 의존성 정직 인정. |