백테스트 전에 정할 것들: 미국 ETF 퀀트 리서치의 질문과 규칙
근거와 검증 범위 — 연구 질문·사전 계획
미국 ETF 연구의 질문·대상·비교 규칙을 사전에 정리하는 글입니다. 앞선 방법론 연재나 이번 계획을 실제 투자 성과·생산성 개선의 증거로 제시하지 않습니다.
Python 기초를 배웠다면 곧바로 가격 데이터를 내려받고 전략을 짜고 싶어질 수 있다. 하지만 첫 퀀트 리서치에서 더 중요한 산출물은 수익률 그래프가 아니라, 결과를 보기 전에 써 둔 질문과 비교 규칙이다. 그래야 나중에 마음에 드는 결과만 고르는 일을 줄이고, 실패한 실험도 다음 판단에 쓸 수 있다.
이 글은 미국 상장 ETF만을 대상으로 하는 새 8편 시리즈의 출발점이다. 앞선 「퀀트 투자와 AI」 12편에서는 검증 방법론을 정리했다. 그 연재가 실제 투자 성과나 생산성 개선을 입증한 것은 아니다. 이번 시리즈에서는 작은 연구를 사전에 설계하고 기록하는 방법에 집중한다.
이 시리즈가 다룰 범위
| 편 | 주제 | 핵심 질문 |
|---|---|---|
| 1편 | 질문과 실험 범위 | 무엇을 검증할 것인가? |
| 2편 | 데이터 | 어디서 어떤 권한과 가격 정의로 데이터를 확보할 것인가? |
| 3편 | 시점 테스트 | 신호와 레이블을 그 시점에 정말 알 수 있었는가? |
| 4편 | 기준선 백테스트 | 단순 기준선과 같은 조건에서 비교했는가? |
| 5편 | 비용과 위험 | 거래비용·낙폭·회전율을 함께 봤는가? |
| 6편 | 로지스틱 비교 | 단순 규칙과 분류모형을 같은 시간 분할에서 비교했는가? |
| 7편 | 기록 자동화 | 코드·데이터·실행 기록을 어떻게 보존할 것인가? |
| 8편 | 시스템·AI 평가 | AI 사용과 검토 비용까지 포함해 무엇을 평가할 것인가? |
이번 글의 목표는 전략을 완성하는 일이 아니다. 연구 노트에 다음 네 가지를 먼저 기록하는 일이다.
- 비교할 기준선과 검증할 가설
- 신호·매매·비용에 관한 사전 규칙
- 성과를 보기 전에 고정할 기간 분할과 반증 조건
- 다음 편에서 확인할 데이터 공급자·가격 정의·보존 조건
ETF보다 먼저 질문을 문장으로 고정하기
“무엇이 오를까?”는 흥미로운 질문이지만 연구 질문으로는 너무 넓다. 이 글에서 사용할 질문은 더 좁고 반증 가능해야 한다.
SPY·IEF·GLD 가운데 직전 12개월 수익률이 양수인 ETF만 월별로 동일가중 보유하는 규칙은, 같은 평가 기간의 단순 매수 후 보유보다 비용 후 수익·낙폭·회전율 측면에서 어떤 차이를 보이는가?
이 문장은 수익을 약속하지 않는다. 오히려 기준선보다 비용 후 수익이 일관되게 불리하거나, 낙폭 또는 회전율의 대가를 납득하기 어렵다면 이 규칙을 채택하지 않겠다는 반증 조건을 함께 담는다.
12개월 양의 모멘텀은 출발 가설일 뿐이다. 선행 연구는 유동성이 높은 주가지수·통화·상품·채권 선물 58개 시장에서 1개월부터 12개월까지의 수익 지속성을 보고했다. 그러나 그 표본은 ETF가 아니며, SPY·IEF·GLD 조합이나 동일가중 규칙, 비용 후 성과를 보장하지 않는다. [S4]
세 ETF는 추천 목록이 아니라 교육용 범위다
이 연구는 미국 상장 ETF 세 개로 범위를 제한한다. 이는 주식·국채·금 가격 노출을 한 실험 안에서 비교하기 위한 교육용 선택이지, 최적의 후보군이나 매수 추천이 아니다.
| ETF | 공식 자료상 자산 노출 | 이 연구에서의 역할 |
|---|---|---|
| SPY | 미국 대형주 부문을 측정하는 S&P 500 지수 노출 [S1] | 주식 위험자산의 한 축 |
| IEF | 잔존만기 7~10년 미국 국채 노출 [S2] | 중기 미국 국채의 한 축 |
| GLD | 비용 차감 전 금 현물 가격 성과 반영을 목표 [S3] | 금 가격 노출의 한 축 |
SPY는 S&P 500의 가격·수익률 성과를 일반적으로 추종하며, S&P 500은 미국 대형주 부문을 측정하는 지수다. SPY의 설정일은 1993년 1월 22일이다. [S1] IEF는 7~10년 잔존만기의 미국 국채를 포함하는 지수 노출을 제공하며, 설정일은 2002년 7월 22일이다. [S2] GLD는 비용 차감 전 금 현물 가격 성과를 반영하는 것을 목표로 하며, 설정일은 2004년 11월 18일이다. [S3]
세 상품이 모두 2006년 이전에 설정됐다는 사실은 확인할 수 있다. 그러나 그것이 2006년부터 2025년까지 재현 가능한 일별 가격 데이터가 이미 확보됐다는 뜻은 아니다. 가격 조정 방식, 배당 처리, 결측, 거래일 달력, 이용 권한과 재배포 조건은 별도로 확인해야 한다. [S1] [S2] [S3]
또한 지금까지 살아남은 상품만 골라 과거에 적용하는 설계에는 생존편향 한계가 있다. 생존으로 잘린 표본은 예측 가능성이 있는 것처럼 보이게 할 수 있다는 연구 결과가 있으므로, 이 세 ETF가 당시의 완전한 투자 가능 집합을 대표하거나 역사적으로 최적이었다고 주장하지 않는다. [S5]
결과를 보기 전에 매매 규칙을 적는다
이번 연구의 규칙은 시장의 사실이 아니라, 재현성을 위한 교육용 근사다. 나중에 데이터를 확보한 뒤에도 결과에 맞춰 바꾸지 않도록 먼저 적어 둔다.
신호일은 각 월말이다. 각 ETF의 직전 12개월 수익률이 양수이면 다음 달 보유 후보에 넣는다. 월말에 계산한 신호는 다음 거래일 종가에 실행한 것으로 근사하고, 체결 이후의 수익부터 새 비중을 적용한다.
선택된 ETF가 있으면 동일가중한다. 하나도 선택되지 않으면 현금 비중을 100%로 둔다. 현금 수익률은 0%로 가정한다. 편도 거래비용은 0bp, 5bp, 10bp, 20bp의 네 시나리오로 비교한다.
이 규칙은 실제 주문 체결을 재현했다는 선언이 아니다. ETF의 보고 가격, 순자산가치, 시장에서의 실제 체결 가격은 다를 수 있으므로, 다음 단계에서 가격 정의와 체결 근사가 연구 목적에 맞는지 검토해야 한다. [S2] [S3]
기준선과 평가 기준을 같이 고정한다
모멘텀 규칙은 단독으로 “좋다”고 판단하지 않는다. 같은 기간과 같은 비용 틀에서 단순한 기준선과 비교해야 한다.
기준선은 시작 시점에 SPY·IEF·GLD를 동일가중으로 매수한 뒤 추가 리밸런싱 없이 보유하는 단순 매수 후 보유로 둔다. 비교 대상은 이 기준선과 12개월 양의 모멘텀 규칙이다. 두 전략은 같은 가격 정의와 같은 평가 기간을 사용하고, 비용 시나리오에서는 각 전략의 실제 거래에만 편도 비용을 적용해야 한다.
평가는 세 항목으로 제한한다.
- 비용 후 수익: 비용을 빼고도 차이가 남는가?
- 최대낙폭: 더 높은 수익이 아니라 손실 경로까지 감수할 만한가?
- 회전율: 전략의 변화량이 비용과 실행 복잡도를 정당화하는가?
이 비교는 선행 연구를 그대로 재현하거나 미래 성과를 예측하는 절차가 아니다. 선물시장에서 관찰된 수익 지속성이라는 아이디어가 이 제한된 ETF 범위에서도 검증할 가치가 있는지 확인하는 절차다. [S4]
시간 분할은 성과보다 먼저 결정한다
목표 자료 기간은 2006년부터 2025년까지로 둔다. 다만 이는 데이터 가용성을 확인하기 전의 설계안이며, 확보되지 않은 기간을 이미 존재하는 데이터처럼 취급하지 않는다.
설계상 2006년은 신호 계산을 준비하는 구간이다. 2007년부터 2017년까지는 초기 학습·개발 구간, 2018년부터 2020년까지는 검증 구간, 2021년부터 2025년까지는 최종 테스트 구간으로 둔다.
6편에서 로지스틱 회귀를 비교할 때도 이 시간 순서를 유지한다. 신호와 레이블이 각각 언제 이용 가능했는지 확인하고, 결측 처리·표준화 같은 전처리와 모형 학습은 해당 학습창 안에서만 수행한다. 최종 테스트 구간의 성과는 개발 과정에서 반복해서 열람하지 않으며, 적어도 6편의 비교 설계가 갖춰질 때까지 판단 근거로 사용하지 않는다.
데이터가 없는 상태도 연구의 일부다
현재 보유한 가격 CSV와 확정한 데이터 서비스는 없다. 로컬에 Python 3.14.5가 존재한다는 점만 확인했으며, 가상환경·패키지 호환성·실행 가능 상태는 아직 검증하지 않았다.
이전의 소량 접근 시도에서는 Yahoo Chart 응답 429를 관찰했고, Stooq는 브라우저에서 HTML을 확인했지만 CSV를 확보하지 못했다. 이는 당시 프로젝트에서의 관찰일 뿐이며, 특정 서비스의 영구 장애나 일반적인 이용 가능성을 뜻하지 않는다.
따라서 데이터 공급자, 이용 권한, 재배포 조건, 일별 종가와 조정주가의 정의, 배당 처리, 결측 처리, 원본 파일의 보존 방식은 아직 미확정이다. 2편에서는 실제 공급자와 파일을 대상으로 이 조건들을 확인하고, 가격 정의·보존 조건·품질 검사 기준을 결정한다. 상품의 설정일은 그 데이터 요건을 대신 충족하지 않는다. [S1] [S2] [S3]
코드보다 연구 흔적을 남기는 규칙
재현 가능한 시스템은 전략 코드만으로 만들어지지 않는다. 앞으로는 코드, 원본 데이터와 메타데이터, 실행 환경, 의존 패키지, 설정값, 결과 요약을 함께 보존한다.
AI를 사용할 때는 입력과 출력뿐 아니라 사람이 검토·수정한 내용과 시간을 남긴다. 데이터 접근 실패, 가정 변경, 품질 검사 탈락, 재실행 이유도 실패 기록으로 보존한다. 실제 성과와 AI 사용에 따른 시간 절감은 아직 측정하지 않았으므로, 지금은 개선 효과를 주장하지 않는다.
연구 프로젝트는 Content OS와 별도로 관리할 예정이지만 아직 구축되지 않았다. 7편에서는 이 기록 흐름을 자동화하는 방법을 다룬다.
첫 번째 연구 계약
이번 글에서 확정하는 것은 전략의 승패가 아니라 해석의 경계다. 연구 범위는 미국 상장 ETF인 SPY·IEF·GLD로 제한한다. 세 상품은 주식·미국 중기 국채·금 가격 노출을 비교하기 위한 교육용 범위이며, 투자 추천이 아니다. [S1] [S2] [S3]
검증 대상은 12개월 양의 모멘텀이라는 가설이다. 매수 후 보유와 비용 후 수익·최대낙폭·회전율을 비교하고, 현재 생존한 상품을 과거에 적용하는 한계와 데이터 미확정 상태를 결과 해석의 전제로 남긴다. [S4] [S5]
다음 글에서는 전략을 복잡하게 만들지 않는다. 먼저 데이터를 어디서, 어떤 권한과 가격 정의로 확보하고, 어떤 조건으로 보존·검사할지 실제 파일을 기준으로 확인한다.
이 시리즈는 교육·연구 목적의 설계 기록이며, 실제 주문 지시나 특정 상품의 매수·매도 권유가 아니다.
Sources
- [S1] Fact Sheet:State Street® SPDR® S&P 500® ETF Trust, Jun2026 | State Street Investment Management | 2026-06-30 | https://www.ssga.com/library-content/products/factsheets/etfs/us/factsheet-us-en-spy.pdf ↩
- [S2] iShares 7-10 Year Treasury Bond ETF | BlackRock Fund Advisors / iShares | 2026-06-30 | https://www.ishares.com/us/literature/fact-sheet/ief-ishares-7-10-year-treasury-bond-etf-fund-fact-sheet-en-us.pdf ↩
- [S3] Fact Sheet:SPDR® Gold Shares, Jun2026 | State Street Investment Management | 2026-06-30 | https://www.ssga.com/library-content/products/factsheets/etfs/us/factsheet-us-en-gld.pdf ↩
- [S4] Time series momentum | Tobias J. Moskowitz, Yao Hua Ooi, Lasse Heje Pedersen; Elsevier | 2012-05-01 | https://doi.org/10.1016/j.jfineco.2011.11.003 ↩
- [S5] Survivorship Bias in Performance Studies | Stephen J. Brown, William Goetzmann, Roger G. Ibbotson, Stephen A. Ross; Oxford University Press | 2015-05-19 | https://academic.oup.com/rfs/article-abstract/5/4/553/1590264 ↩
오류 제보·의견 보내기
글 제목과 주소가 포함된 메일 초안을 엽니다. 내용과 받는 사람을 확인한 뒤 보내주세요.
받는 사람: [email protected]
메일 앱에서 작성메일 앱이 열리지 않으면 아래 내용을 복사해 평소 쓰는 이메일에 붙여 넣으세요.
관련 글
퀀트·데이터 연구 AI는 퀀트 투자에 실제로 도움이 되는가: 조건부 결론과 검증의 기준
AI의 연구 보조 가치와 투자 수익성을 구분하고, 유용함을 판단할 조건을 정리합니다. 시간순 검증, 기준선 비교와 재현 가능한 기록이 필요한 이유를 살펴봅니다.
퀀트·데이터 연구 가격을 맞히기보다 연구를 검증하기: 퀀트 리서치의 LLM 활용 경계
퀀트 리서치에서 LLM의 역할을 자료 변환, 검증 보조와 의사결정 경계로 나눕니다. 요약과 코드 초안을 원문·원자료와 대조하는 기준을 설명합니다.