금융 머신러닝에서 우연한 결과를 실력으로 오인할 위험과 반증 조건
근거와 검증 범위 — 실패 원인·반증 조건 해설
문헌에 근거해 과적합·누수·비용 등 좋은 결과를 의심할 조건을 설명합니다. 시점 규칙은 교육용 예이며, 실제 체결이나 특정 모델의 우위를 검증한 결과가 아닙니다.
8편에서는 모멘텀, 로지스틱 회귀, 의사결정나무, 랜덤 포레스트를 같은 조건에서 비교하기 위한 설계를 다뤘다. 그것은 실제 ETF 성과나 특정 모델의 우위를 보고한 실험 결과가 아니었다. 이번 글에서는 한 단계 더 나아가, 비교표에서 좋아 보인 결과를 왜 곧바로 “실력”이라고 부르면 안 되는지 살펴본다.
공정한 비교는 출발점이다. 그러나 한 모델이 특정 기간에서 앞섰더라도, 다른 시기와 비용 조건에서도 그 결과가 남는지는 별도로 반증해야 한다.
금융 머신러닝의 실패 가능성은 크게 세 축으로 묶을 수 있다.
| 핵심 축 | 포함 원인 | 먼저 던질 질문 |
|---|---|---|
| 불안정한 데이터 관계 | 1. 신호보다 잡음이 많음<br>2. 시장 관계의 시간 변화 | 다른 기간과 시장 상태에서도 신호가 남는가? |
| 검증·선택 오류 | 3. 과도한 반복 탐색<br>4. 미래 정보 누수<br>6. 좋은 결과만 선택 | 결과를 보기 전의 선택과 본 뒤의 선택을 분리했는가? |
| 경제적 의미 | 5. 비용으로 사라지는 작은 우위 | 비용 후에도 실행할 만한 의미가 남는가? |
이 목록은 특정 실험의 실패 원인을 단정하는 진단서가 아니다. 확정된 데이터, 체결 기록, 실행 결과가 없다면 어느 문제가 실제로 발생했는지 알 수 없다. 대신 좋은 결과를 과신하지 않기 위한 감사 지도라고 보는 편이 정확하다.
| 원인 | 관찰할 증상 | 점검 방법 | 점검의 한계 |
|---|---|---|---|
| 신호보다 잡음이 많음 [S1] | 기간이나 분할을 바꾸면 결과가 크게 흔들림 | 단순 기준선과 비교하고 기간별 결과를 함께 확인 | 변동만으로 잡음 적합이라고 확정할 수 없음 |
| 시장 관계의 시간 변화 [S2][S3][S11][S12] | 특정 시기에는 작동하던 특징이 다른 시기에는 약해짐 | 기간별 오류·특징 변화·시장 상태별 결과 기록 | crowding 등의 원인은 추가 자료 없이는 확정 불가 |
| 과도한 반복 탐색 [S4][S5][S8] | 가장 좋은 설정만 남고 테스트를 본 뒤 설정이 늘어남 | 후보 수·시드·실행 횟수·변경 이력 기록 | 기록만으로 미래 성과가 보장되지는 않음 |
| 미래 정보 누수 [S6] | 당시 알 수 없던 값이 특징·전처리·레이블에 섞임 | 신호일·정보 이용 시각·레이블 확정일·실행일 감사 | 실제 데이터 제공 시각과 체결 가능성은 별도 확인 필요 |
| 비용으로 사라지는 우위 [S7] | 정확도 개선과 달리 비용 후 결과가 약함 | 회전율과 비용 시나리오를 함께 계산 | 암묵적 비용은 체결 자료 없이는 정확히 측정하기 어려움 |
| 좋은 결과만 선택 [S9][S10] | 실패 실행과 불리한 결과가 기록에서 사라짐 | 실패 실행·코드·데이터 시점·선택 규칙 공개 | 복제 실패와 publication bias는 같은 현상이 아님 |
1. 신호보다 잡음이 많을 때
주식수익률 예측은 신호대잡음비가 낮은 문제를 안고 있으며, 유연한 모델일수록 학습 데이터의 우연한 흔들림까지 맞출 위험을 점검해야 한다. [S1]
여기서 잡음은 단순한 오류 데이터만 뜻하지 않는다. 미래와 안정적으로 연결되지 않는 일회성 움직임도 모델에는 설득력 있는 패턴처럼 보일 수 있다. 학습 구간에서 성과가 좋아 보이지만 날짜 경계나 학습창을 조금만 바꿨을 때 결과가 크게 달라진다면, 모델이 신호보다 표본의 흔들림을 많이 배웠을 가능성을 의심할 수 있다.
복잡한 모델이 항상 나쁘다고 단정할 수는 없다. 유연한 모형일수록 관계를 찾은 것인지 잡음을 적합한 것인지 점검할 필요가 더 커진다. [S1]
점검할 때는 모멘텀 같은 단순 기준선과 ML 모델을 같은 시간 순서로 비교하고, 평균 성과 하나보다 기간별 성능과 분할별 변동을 함께 남긴다. 한 번 잘 맞았다는 사실보다 조건이 달라져도 비슷한 방향으로 남는지가 더 강한 반증 조건이다.
그러나 결과가 흔들린다는 사실만으로 잡음 적합이라고 결론 내리면 안 된다. 다음 절의 시장 관계 변화나 비용·실행 가정 차이도 함께 작용했을 수 있다.
2. 시장 관계가 시간에 따라 바뀔 때
시간 변화는 비슷해 보이는 세 용어를 구분하면 이해하기 쉽다.
- regime change는 비정상 시계열에서 관측되지 않은 상태가 전환하면서 관계가 달라질 수 있다는 설명이다. 하나의 고정 규칙만으로 모든 구간을 설명할 수 있는지는 점검 대상이 된다. [S3]
- concept drift는 입력 데이터의 분포 또는 입력과 정답 사이의 관계가 시간에 따라 변하는 더 넓은 머신러닝 개념이다. [S2]
- feature decay는 한때 유용했던 특징의 예측상 또는 경제적 효과가 시간이 지나며 약해지는 현상을 가리키는 실무적 표현이다. 발표된 수익 예측 변수에서 표본 밖과 발표 후 효과 약화가 관찰된 연구는 이 가능성을 점검할 이유를 제공한다. [S12]
따라서 특정 구간에서 잘 맞았던 모멘텀, 변동성, 거래량 특징이 이후에도 같은 방식으로 작동한다고 가정할 수 없다. 기간별 오류, 특징 중요도의 변화, 시장 상태별 결과를 나눠 기록하는 이유가 여기에 있다. [S2][S3]
비슷한 요인을 많은 참여자가 함께 활용하면 상관된 거래와 유동성 문제가 생길 수 있다는 연구도 있다. [S11] 다만 개별 ETF 실험에서 crowding이 원인이었다고 말하려면 보유 겹침, 주문 흐름, 유동성, 시장충격 자료가 필요하다. 그런 자료가 없다면 crowding은 가능한 설명 후보일 뿐이다.
시간 변화는 실패의 확정 원인이 아니라, 하나의 고정 규칙을 믿지 않게 만드는 점검 대상이다.
3. 모델과 파라미터를 너무 많이 탐색할 때
같은 데이터를 모델 선택에 반복 사용하면, 우연히 만족스러운 결과를 좋은 방법의 성과로 오해할 수 있다. 이것이 data snooping의 핵심 위험이며, 많은 전략·파라미터 변형 가운데 표본 내 최적안을 고르는 과정은 백테스트 과적합으로 이어질 수 있다. [S4][S5]
예를 들어 트리 깊이, 리프 크기, 랜덤 포레스트의 트리 수와 특징 수, 매수 임계값, 비용 가정을 차례로 바꾸면서 결과를 계속 본다고 하자. 마지막에 남은 설정은 처음부터 검증하려던 하나의 가설이 아니다. 특히 테스트 구간 성과를 확인한 뒤 후보, 임계값, 비용 가정을 바꾸는 일은 단순 조정이 아니라 새 탐색으로 기록해야 한다. [S4][S5][S8]
실험 전에는 탐색 예산을 정해 두는 편이 좋다. 후보 목록, 실행 횟수, 난수 시드, 선택 기준, 테스트 구간을 열람한 시점과 이후 변경을 남긴다. 테스트를 본 뒤 생긴 아이디어는 기존 테스트 구간에서 다시 고르지 않고 별도 탐색으로 분리한다.
이 절차가 과적합을 자동으로 없애지는 않는다. 다만 “몇 번 시도 끝에 나온 가장 좋은 결과인가”를 숨기지 않게 해 준다. 테스트 구간은 성적표이지 다음 선택을 위한 무한한 실험실이 아니다.
4. 미래 정보 누수
누수는 예측 목표에 대해 정당하게 이용할 수 없는 정보를 모델링에 넣는 문제다. 중요한 것은 데이터 열에 값이 존재하는지가 아니라, 투자 의사결정 시점에 그 값을 실제로 알 수 있었는지다. [S6]
ETF 패널을 예로 들면 각 행에 적어도 다음 네 시점을 분리해 기록할 수 있다.
| 기록 항목 | 점검 질문 |
|---|---|
signal_date | 언제 신호를 만들었는가? |
| 특징 이용 가능 시각 | 해당 특징은 신호 시점 전에 확정됐는가? |
label_end_date | 미래 레이블은 언제 확정됐는가? |
| 실행일 | 신호 뒤 언제, 어떤 가격으로 거래했다고 가정하는가? |
월말에 신호를 만들고 다음 거래일 종가에 실행한다고 두는 것은 교육용 시점 규칙의 한 예다. 이는 실제로 그 종가에 원하는 수량이 체결됐다는 뜻이 아니다. 또한 레이블이 확정되기 전의 행은 학습에 넣지 않고, 표준화나 결측치 처리 같은 전처리는 각 학습 구간에서만 적합해야 한다. 이 글의 시점 정합성 감사 규칙으로는 같은 날짜의 ETF 행을 학습·검증·테스트에 흩어지지 않도록 날짜 단위로 함께 분할할 수 있다. 이 규칙만으로 누수가 없었다고 입증되지는 않는다. [S6]
수정주가의 이용 가능 시각, 상장폐지 처리, ETF 편입 종목 변화, 장 마감 체결 가능성은 별도 자료로 확인해야 한다. 위 규칙은 누수 방지를 위한 감사 설계이지, 실제 구현이 누수 없이 수행됐다는 성과 보고가 아니다.
5. 비용으로 사라지는 작은 예측 우위
포트폴리오 거래비용에는 수수료뿐 아니라 스프레드, 시장충격, 기회비용이 포함되며, 암묵적 비용은 직접 측정하기 어렵다. [S7] 따라서 정확도나 모델 점수가 조금 높아졌다는 사실만으로 경제적 의미를 주장할 수는 없다.
다음은 실제 ETF 성과가 아닌 산술 예시다.
가정: 거래 전 총 기대우위가 10bp이고 왕복 비용이 14bp라면, 비용 후 순효과는
10bp - 14bp = -4bp다.
예측 우위가 작다면 비용은 결과의 방향을 바꿀 수 있다. 특히 신호가 자주 바뀌어 회전율이 높아지는 모델은 정확도가 개선돼도 비용 후 결과가 약해질 수 있다.
점검할 때는 회전율과 함께 수수료, 스프레드, 시장충격, 기회비용을 구분한 비용 시나리오를 둔다. 월말 신호 뒤 다음 거래일 종가 실행이라는 규칙도 계산 편의를 위한 가정일 뿐, 실제 체결 가격이나 체결 가능성을 보장하지 않는다. [S7]
실행 자료가 없다면 비용을 하나의 정확한 숫자로 확정하지 않는 편이 정직하다. 비용 후에도 결과가 남는지 확인하는 일은 필요하지만, 그 확인만으로 미래 실행 가능성이 보장되지는 않는다.
6. 좋은 결과만 선택하는 연구자 편향
연구자 편향은 두 층으로 나눠 볼 필요가 있다. 첫째는 연구 내부에서 여러 후보를 시도한 뒤 좋은 결과만 남기는 선택이다. 같은 데이터의 반복 사용, 대규모 탐색, 다중검정은 우연히 좋은 결과를 고를 위험을 높인다. [S4][S5][S8] 둘째는 논문이나 보고서 단계에서 유리한 결과가 더 공개되기 쉬운 publication bias다. [S10] 두 현상은 관련돼도 같은 질문은 아니다.
대규모 이상현상 복제 연구에서는 표본 구성, 가중 방식, 다중검정 기준을 달리했을 때 다수의 결과가 기존 기준을 통과하지 못할 수 있음을 보여 줬다. 이는 재현 절차와 설계 선택을 공개할 필요를 뒷받침한다. [S9] 한편 publication bias와 표본 밖 약화는 구분해 측정해야 하며, 그 영향의 크기와 해석에는 불확실성이 남는다. [S10]
그래서 어느 한 연구만으로 “대부분의 금융 ML 결과는 거짓” 또는 “편향은 무시해도 된다”고 결론 내릴 수 없다. 대신 실패한 실행, 제외한 후보, 변경한 규칙, 사용한 데이터 시점과 코드를 남겨 제3자가 같은 조건에서 다시 확인할 수 있게 해야 한다.
재현성은 좋은 결과를 보장하는 장치가 아니다. 결과를 확인하거나 반박할 수 있게 만드는 연구의 조건이다. 실패한 실행도 버릴 부산물이 아니라, 선택 과정의 일부다.
좋은 결과에 붙여야 할 반증 조건
금융 ML에서 더 중요한 질문은 “어떤 모델이 가장 좋아 보였는가”가 아니다. 다음 세 질문에 답할 수 있는지가 더 중요하다.
- 다른 기간, 다른 분할, 다른 시장 상태에서도 결과가 남는가? [S1][S2][S3]
- 후보 수, 실행 횟수, 테스트 열람 뒤의 변경, 시점 규칙을 공개해도 같은 결론을 검토할 수 있는가? [S4][S5][S6][S8][S9][S10]
- 수수료뿐 아니라 스프레드, 시장충격, 기회비용을 고려한 비용 후에도 경제적 의미가 남는가? [S7]
이 질문에 아직 답하지 못한 결과를 실패라고 단정할 필요는 없다. 그러나 투자 우위라고 부르기에도 이르다. 가장 정확한 이름은 추가 검증이 필요한 가설이다.
다음 실험에서는 성과 그래프보다 먼저 데이터 시점, 탐색 이력, 비용 가정, 실패 실행 기록을 점검해 보자. 다음 10편에서는 LLM을 가격 예측기로 과신하기보다 리서치 정리, 코딩 보조, 오류 점검에 어디까지 활용할 수 있는지 살펴본다.
이 글은 교육·연구 목적의 방법론 설명이며, 특정 ETF나 금융상품의 매매를 권유하지 않는다.
Sources
- [S1] Empirical Asset Pricing via Machine Learning | The Review of Financial Studies / Shihao Gu, Bryan Kelly, Dacheng Xiu | 2020-02-26 | https://doi.org/10.1093/rfs/hhaa009 ↩
- [S2] A Survey on Concept Drift Adaptation | Association for Computing Machinery / João Gama, Indrė Žliobaitė, Albert Bifet, Mykola Pechenizkiy, Abdelhamid Bouchachia | 2014 | https://dl.acm.org/doi/10.1145/2523813 ↩
- [S3] A New Approach to the Economic Analysis of Nonstationary Time Series and the Business Cycle | Econometric Society / James D. Hamilton | 1989-03-01 | https://www.jstor.org/stable/1912559 ↩
- [S4] A Reality Check for Data Snooping | Econometric Society / Halbert White | 2000-09 | https://doi.org/10.1111/1468-0262.00152 ↩
- [S5] Backtest Overfitting in Financial Markets | eScholarship, University of California / David H. Bailey, Jonathan M. Borwein, Marcos López de Prado, Amir Salehipour, Qiji Jim Zhu | 2016 | https://escholarship.org/uc/item/4hn4t174 ↩
- [S6] Leakage in data mining: Formulation, detection, and avoidance | Association for Computing Machinery / Shachar Kaufman, Saharon Rosset, Claudia Perlich, Ori Stitelman | 2012-12 | https://dl.acm.org/doi/10.1145/2382577.2382579 ↩
- [S7] Request for Comments on Measures To Improve Disclosure of Mutual Fund Transaction Costs | U.S. Securities and Exchange Commission | 2003-12-19 | https://www.sec.gov/rules-regulations/2003/12/request-comments-measures-improve-disclosure-mutual-fund-transaction-costs ↩
- [S8] … and the Cross-Section of Expected Returns | The Review of Financial Studies / Campbell R. Harvey, Yan Liu, Heqing Zhu | 2015-10-09 | https://academic.oup.com/rfs/article-abstract/29/1/5/1843824 ↩
- [S9] Replicating Anomalies | The Review of Financial Studies / Kewei Hou, Chen Xue, Lu Zhang | 2018-12-10 | https://doi.org/10.1093/rfs/hhy131 ↩
- [S10] Publication Bias and the Cross-Section of Stock Returns | Board of Governors of the Federal Reserve System / Andrew Y. Chen, Tom Zimmermann | 2020-01-09 | https://www.federalreserve.gov/econres/feds/publication-bias-and-the-cross-section-of-stock-returns.htm ↩
- [S11] FACTOR CROWDING AND LIQUIDITY EXHAUSTION | Journal of Financial Research / Joseph M. Marks, Chenguang Shang | 2018-12-04 | https://doi.org/10.1111/jfir.12165 ↩
- [S12] Does Academic Research Destroy Stock Return Predictability? | The Journal of Finance / R. David McLean, Jeffrey Pontiff | 2015-10-13 | https://onlinelibrary.wiley.com/doi/abs/10.1111/jofi.12365 ↩
오류 제보·의견 보내기
글 제목과 주소가 포함된 메일 초안을 엽니다. 내용과 받는 사람을 확인한 뒤 보내주세요.
받는 사람: [email protected]
메일 앱에서 작성메일 앱이 열리지 않으면 아래 내용을 복사해 평소 쓰는 이메일에 붙여 넣으세요.
관련 글
퀀트·데이터 연구 로지스틱 회귀는 기준선을 넘을까? 공정한 모델 비교의 조건
로지스틱 회귀와 기준 전략을 공정하게 비교하기 위한 시간축, 데이터 분리, 재학습과 비용 계산 규칙을 정리합니다. 실제 성과 검증에 앞서 고정할 실험 설계입니다.
퀀트·데이터 연구 shift(1)만으로는 부족하다: 신호·체결·레이블의 시간 계약
신호 생성, 주문 체결, 수익 귀속과 레이블 확정 시점을 구분합니다. 합성 단위테스트로 미래정보 누수와 전처리의 시간 경계를 점검합니다.