퀀트 투자에 AI가 정말 도움이 될까? 직접 검증을 시작합니다
근거와 검증 범위 — 역할·위험 정리와 후속 실험 계획
외부 연구를 바탕으로 AI의 예측·리서치·자동화 역할과 위험을 정리합니다. 비교 실험은 후속 계획이며, 외부 문서 업무의 시간 절감 결과를 투자 수익률이나 이 프로젝트의 성과로 간주하지 않습니다.
머신러닝의 제한적 예측부터 LLM을 활용한 리서치와 자동화까지, 개인 투자자가 기대할 수 있는 효과와 반드시 확인해야 할 위험을 살펴본다.
공시를 읽고, 가격 데이터를 정리하고, 백테스트 코드를 작성하다 보면 자연스럽게 이런 생각이 든다.
“AI를 이용하면 투자 판단과 퀀트 연구를 더 잘할 수 있지 않을까?”
자료 조사와 계산이 빨라지면 더 많은 가설을 시험하고, 사람이 놓치던 패턴도 발견할 수 있을 것처럼 보인다.
하지만 여기서 한 번 멈춰야 한다. 빨라진 것과 정확해진 것은 같은가?
생성형 AI가 일반 지식노동의 일부 문서 처리 시간을 줄일 수 있다는 현장실험 결과는 있다. 그러나 그 연구는 투자 리서치나 투자수익률을 측정한 것이 아니다.[S9] AI가 보고서 초안을 빨리 만드는 것과 비용을 차감한 투자성과를 개선하는 것은 완전히 다른 문제다.
그래서 다른 사람의 성공담이나 인상적인 백테스트를 그대로 받아들이기보다 직접 비교해 보기로 했다. 앞으로 이 시리즈에서는 AI가 실제로 개선하는 것이 무엇인지 항목별로 확인할 것이다.
AI가 줄여 주는 것은 조사 시간일까, 오류 건수일까, 예측 오차일까, 아니면 비용후 위험조정 성과를 개선하는 데까지 이어질까?
이번 글은 그 실험의 출발점이다. AI가 퀀트 투자에서 맡을 수 있는 역할을 예측, 리서치, 자동화로 나누고, 결과를 믿기 전에 알아야 할 위험과 앞으로의 비교 계획을 정리한다.
특정 종목을 추천하거나 매수·매도 시점을 제시하지는 않는다. 개인별 자산배분이나 세금·법률 문제, 수익 보장도 다루지 않는다.
퀀트 투자는 미래를 맞히는 마법이 아니다
퀀트 투자를 처음 접하면 복잡한 수식이나 자동매매 프로그램부터 떠올리기 쉽다. 그러나 이 글에서 말하는 퀀트 투자는 더 단순한 과정이다.
- 확인할 가설을 정한다.
- 그 가설을 시험할 데이터를 준비한다.
- 매매와 위험관리 규칙을 명시한다.
- 과거에 이용 가능했던 정보만 사용해 검증한다.
- 비용과 실패 가능성을 포함해 결과를 평가한다.
즉, 퀀트 투자는 숫자로 미래를 완벽하게 맞히는 방법이 아니라 가설·데이터·규칙·검증을 연결하는 접근이다. AI는 이 과정 전체를 대신하는 존재가 아니라 일부 단계에 사용할 수 있는 도구다.
머신러닝 모델이 내놓을 수 있는 결과도 대개 제한적이다. 자산가격 연구에서 확인된 범위로 예를 들면 다음과 같다.[S1]
- 주어진 조건에서의 기대수익률 또는 위험 프리미엄 추정치
- 여러 자산의 상대적인 기대수익 점수
자산가격 연구에서는 머신러닝이 변수 사이의 비선형 관계와 상호작용을 포착하고, 일부 트리·신경망 모델이 해당 연구의 표본외 평가에서 선형 모형보다 나은 결과를 보인 사례가 있다.[S1] 그러나 이는 특정 미국 시장 데이터와 연구 설계에서 얻은 결과다. 개인 투자자가 같은 모델을 사용하면 같은 성과를 얻는다는 뜻도, AI가 수익을 보장한다는 뜻도 아니다.[S1]
더 중요한 것은 예측 모델과 투자 규칙이 서로 다르다는 점이다.
모델이 어떤 자산의 상승 확률을 55%로 계산했다고 가정해 보자. 이 숫자만으로는 매수 여부를 결정할 수 없다. 예측이 얼마나 잘 보정됐는지, 예상 손실은 얼마인지, 얼마를 투자할지, 얼마나 자주 교체할지, 거래비용을 빼고도 이점이 남는지를 추가로 판단해야 한다. 모델의 목적과 한계를 명시하고 비용과 위험을 별도로 관리해야 한다는 원칙에서 도출되는 실무적인 구분이다.[S4][S6]
AI는 결정을 내리는 전체 시스템이 아니다. 많아야 그 시스템에 들어갈 하나의 점수나 추정치를 제공한다.
같은 ‘AI’가 아니다: 머신러닝, LLM, 일반 자동화
AI라는 단어 하나로 모든 기술을 묶으면 무엇이 효과가 있었고 어디서 오류가 났는지 판단하기 어렵다. 퀀트 연구에서는 적어도 세 범주를 구분할 필요가 있다.
| 구분 | 주된 입력 | 주된 출력 | 검토할 역할 | 대표적인 한계 |
|---|---|---|---|---|
| 전통적 머신러닝 | 가격·거래량·재무지표 등의 표 데이터 | 확률·점수·기대값 | 조건부 기대수익률과 위험 프리미엄의 제한적인 예측[S1] | 특정 연구에서 가능성이 관찰됐지만 개인 투자자의 성과나 수익을 보장하지 않음[S1] |
| 생성형 AI·LLM | 공시·논문·질문 등의 텍스트 | 요약·분류·초안·설명 | 일반 문서 처리에서 관찰된 제한적 시간 절약의 투자 리서치 적용 가능성 검토[S9] | 환각과 출처 오류[S7], 금융 과제의 평가자료 불균형과 지시 수행 한계[S10] |
| 일반 자동화 | API·파일·고정 규칙 | 정리된 데이터·검사 결과·보고서 | 데이터 수집과 변경 감시 등 반복 절차[S8] | 데이터 의미와 처리 규칙을 사용자가 검증해야 함[S8] |
전통적 머신러닝은 주로 숫자로 표현된 과거 데이터에서 조건부 기대수익률이나 위험 프리미엄을 추정하고 자산의 상대적 점수를 계산하는 데 쓰일 수 있다.[S1]
생성형 AI와 대규모 언어 모델, 즉 LLM의 활용 범위는 별도로 살펴봐야 한다. 일반 지식노동에서는 일부 문서 처리 시간을 줄인 결과가 관찰됐지만, 이는 투자 리서치의 품질이나 수익률 개선을 입증한 연구가 아니다.[S9] 금융 텍스트 처리에서도 활용 가능성은 있지만 표면적인 정확도가 데이터 불균형으로 부풀려지거나 금융 특화 모델이 지시 수행과 언어 생성에서 약점을 보일 수 있다.[S10] 또한 LLM은 사실이 아닌 내용을 그럴듯하게 생성할 수 있다.[S7]
데이터를 내려받고 변경 사항을 확인하는 작업은 AI 없이도 일반 프로그램으로 자동화할 수 있다.[S8] 예를 들어 미국 증권거래위원회의 EDGAR는 기업별 제출 이력과 일부 XBRL 재무 데이터를 JSON API로 제공하므로, 미국 공시의 수집과 변경 감시 절차를 프로그램화할 수 있다.[S8]
이 구분이 중요한 이유는 간단하다.
LLM이 문서를 자연스럽게 다루는 능력과 미래 투자수익을 예측하는 능력은 별개의 주장이다.[S10]
문서를 잘 다루는 모델이 실제 초과수익도 만든다고 가정해서는 안 된다. 코드 작성과 설명을 얼마나 효과적으로 보조하는지도 확인된 성과로 전제하지 않고, 후속 실험에서 테스트 통과율, 재현성, 수정 시간과 오류 건수로 측정할 가설로 다룰 것이다.
역할 ① 가격과 위험을 제한적으로 예측하기
머신러닝의 첫 번째 역할은 가격이나 위험에 관한 질문을 측정 가능한 제한된 목표로 바꾸어 추정하는 것이다.
이번 시리즈에서는 우선 다음과 같은 목표를 구분해 살펴볼 계획이다.
- 다음 기간 수익률이 0보다 높은지 분류하기
- 주어진 조건에서 기대수익률이나 위험 프리미엄 추정하기
- 여러 자산을 상대적인 기대수익 점수로 정렬하기
- 향후 변동성이나 큰 손실 가능성을 별도의 목표로 정의해 실험할 수 있는지 검토하기
- 특정 시장 상태의 분류가 유용한 실험 목표가 될 수 있는지 검토하기
이 가운데 자산가격 연구에서 직접 확인된 가능성은 조건부 기대수익률·위험 프리미엄을 추정하고 상대적 점수를 만드는 범위다.[S1] 변동성, 큰 손실 확률과 시장 상태 예측은 이 글에서 효과가 확인된 기능으로 제시하지 않는다. 후속 실험의 목표 후보로 정의할 수 있는지부터 검토해야 한다.
이런 문제에서도 모델은 미래를 아는 것이 아니다. 과거 데이터에서 관찰된 조건과 결과의 관계를 압축해 새로운 입력에 확률이나 점수를 부여할 뿐이다.[S1]
트리 모델은 변수 사이의 비선형 관계와 상호작용을 포착할 수 있다.[S1] 실제 자산가격 연구에서도 트리와 신경망이 이러한 관계를 활용할 가능성을 보였다.[S1]
그러나 복잡한 관계를 표현할 수 있다는 사실은 그 관계가 미래에도 유지된다는 보장이 아니다. 모델이 똑똑해 보일수록 더 많은 설정을 시험하고 싶은 유혹도 커진다. 반복적으로 설정을 시험하면 과거 데이터의 우연한 특징에 잘 맞는 백테스트 승자를 선택할 위험이 커진다.[S3]
예측치는 매매 규칙과 구분해야 한다. 모델이 내놓은 확률이나 점수를 실제 매매로 전환하려면 별도의 의사결정 규칙이 필요하며, 그 구체적인 조건은 뒤의 비교 실험 설계에서 한꺼번에 고정한다.
앞으로 비교할 로지스틱 회귀와 트리 모델 가운데 어느 쪽이 더 낫다고 미리 선언할 근거도 없다. 결과는 데이터, 예측 목표, 기간, 모델 설정과 비용에 따라 달라질 수 있다. 바로 그렇기 때문에 같은 조건에서 직접 비교해야 한다.
역할 ② 투자 리서치의 보조 도구로 쓰기
LLM은 자동 종목 선정기가 아니라 조사 과정의 보조 도구로 활용할 가능성을 검토할 수 있다. 생성형 AI가 일반 지식노동의 일부 문서 처리 시간을 줄였다는 현장실험은 리서치 초안·요약 업무의 시간 절약 가능성을 간접적으로 보여주지만, 투자 리서치의 질이나 판단 정확도, 투자수익률 개선을 입증하지는 않는다.[S9] 금융 텍스트 처리에서도 활용 가능성은 관찰됐으나, 표면적인 정확도가 클래스 불균형으로 부풀려지거나 금융 특화 모델이 지시 수행과 언어 생성에서 약점을 보인 특정 벤치마크가 있다. 따라서 문서를 처리하는 능력과 투자성과를 높이는 능력은 별도로 평가해야 한다.[S10]
예를 들어 후속 실험에서는 다음과 같은 작업을 보조하도록 해볼 수 있다.
- 긴 공시에서 사업 부문과 위험 요인의 목록 초안 만들기
- 여러 문서의 공통 항목을 비교할 표 구조 제안받기
- 낯선 재무·통계 용어를 쉬운 말로 설명받기
- 연구 가설과 그 가설을 반박할 질문을 함께 만들기
- 백테스트 코드의 흐름을 설명받기
- 필요한 테스트 항목이나 예외 상황 제안받기
- 실험 조건과 수정 이력을 일정한 형식으로 정리하기
이 목록은 확인된 효과가 아니라 후속 실험의 대상이다. 코드 설명·작성과 연구 기록 보조가 시간을 줄이는지, 조사 질문의 범위를 넓히는지, 오류 감소로 이어지는지도 후속 실험에서 측정할 가설이다.
따라서 LLM의 결과물은 완성된 분석이 아니라 검토가 필요한 초안으로 다뤄야 한다.
실제로 사용할 때에는 다음 절차가 필요하다.
- 답변에 포함된 원문 링크를 직접 연다.
- 수치와 단위가 원문 표에 맞는지 확인한다.
- 인용문, 저자와 발행 정보를 대조한다.
- 계산은 별도 코드나 스프레드시트에서 재현한다.
- 생성된 코드는 단위 테스트와 작은 표본으로 먼저 실행한다.
- 요약에서 누락된 반대 근거나 예외가 없는지 찾는다.
- 투자 결론은 챗봇 답변이 아니라 검증된 자료와 미리 정한 규칙으로 판단한다.
LLM은 그럴듯하지만 틀린 사실이나 출처를 생성할 수 있고, 이러한 환각은 완전히 제거되지 않았다.[S7] 투자자 경보에서도 AI 생성 정보가 부정확하거나 오래됐거나 완전히 만들어진 내용일 수 있으므로 원 출처와 복수 자료를 확인하라고 경고한다.[S11]
현재 확인된 근거만으로는 LLM을 사용한 개인 투자자의 장기 수익률이 개선된다고 말할 수 없다. 생성형 AI가 작성한 퀀트 코드의 평균 오류율도 이번 조사에서는 확인하지 못했다. 따라서 코드 보조의 효용은 막연한 만족도가 아니라 테스트 통과율, 재현성, 사람이 수정한 시간과 오류 건수로 따로 측정해야 한다.
역할 ③ 데이터·코드·보고서의 반복 작업 자동화
공식 API와 일반 프로그램을 이용하면 데이터 수집과 변경 감시 같은 반복 작업을 자동화할 수 있다.[S8] 생성형 AI가 일부 일반 문서 업무의 시간을 줄일 가능성도 관찰됐지만, 이는 투자 연구에서 자동화가 예측보다 더 큰 가치를 낸다는 비교 근거는 아니다.[S9]
자동화할 만한 작업은 많다.
- 공식 API에서 공시와 데이터를 정해진 주기로 수집하기
- 가격·재무 데이터 갱신하기
- 결측치, 중복값과 비정상값 검사하기
- 같은 조건으로 여러 모델의 백테스트 실행하기
- 비용 차감 전후 결과표 만들기
- 모델 버전과 수정된 가정 기록하기
- 실험 결과와 오류 로그를 정해진 형식으로 저장하기
SEC EDGAR는 인증키 없이 기업 제출 이력과 일부 XBRL 재무 데이터를 받을 수 있는 API 및 대량 파일을 제공한다.[S8] 따라서 미국 공시를 수집하고 신규 제출을 감시하는 과정은 프로그램으로 반복할 수 있다.
다만 API가 공식적이라고 해서 데이터가 분석에 바로 쓸 수 있는 것은 아니다. 기업별 XBRL 태그 차이, 정정 공시와 보고기간의 차이는 사용자가 별도로 확인해야 한다.[S8] LLM이 수집 코드를 작성해 주더라도 필드의 의미와 시점을 검증하는 책임은 사라지지 않는다.
자동화의 목표를 단순히 클릭 수를 줄이는 것으로 잡아서는 안 된다. 같은 입력에서 결과가 재현되는지, 오류 발생 단계를 추적할 수 있는지, 데이터 변경과 모델·비용 가정의 버전이 기록되는지, 사람이 검사할 항목이 명확한지를 함께 확인해야 한다.
AI 활용에서 먼저 알아야 할 다섯 가지 위험
이번 글에서는 다섯 가지 핵심 위험의 개념만 살펴본다. 누수를 막는 구체적인 방법, 워크포워드 검증, 반복 탐색 통제와 비용 계산은 후속 편에서 자세히 다룰 예정이다.
1. 데이터 누수: 시험 답안을 학습 자료에 섞는 실수
데이터 누수는 모델을 시험할 때 사용해서는 안 될 미래 정보를 학습 과정에 섞는 문제다. 시험 답안을 미리 본 학생에게 같은 문제를 풀게 하는 것과 비슷하다.
시간 순서가 있는 데이터에 일반적인 무작위 분할을 적용하면 모델이 미래 관측치로 학습한 뒤 과거 구간에서 평가되는 상황이 생길 수 있다.[S2] 금융 시계열은 앞선 기간에서 학습하고 그보다 뒤의 기간에서 평가해야 하며, 마지막 판단은 모델 선택에 사용하지 않은 구간에서 내려야 한다.[S2][S6]
그러나 시계열 분할은 발표 지연, 사후 수정 데이터나 생존편향을 자동으로 해결하는 도구가 아니다.[S2] 따라서 날짜 열을 정렬한 뒤에도 재무정보가 실제로 알려진 시점, 사후 수정 여부, 자료가 살아남은 종목만 포함하는지를 별도로 점검해야 한다. [S2]는 시간 순서 분할의 필요성을 설명하지만 이러한 금융 데이터 문제의 해결 방법까지 제공하지는 않는다.
LLM에는 추가적인 공백이 있다. 폐쇄형 모델의 학습 데이터에 역사적 평가 시점 이후의 정보가 포함됐는지 외부에서 완전히 확인하기 어렵다. 따라서 현재의 LLM에게 과거 뉴스나 공시를 보여 주고 “당시 어떤 일이 일어날지 예측하라”고 요구하는 실험은 모델 자체의 시간 누수를 완전히 배제하기 어렵다.
2. 백테스트 과적합: 가장 예쁜 결과만 고르기
기간, 변수, 매매 기준과 모델 설정을 수백 번 바꾼 뒤 가장 좋은 결과만 선택했다고 생각해 보자. 선택된 전략은 진짜 규칙을 찾은 것일 수도 있지만, 수많은 시도 가운데 우연히 과거 데이터에 잘 맞은 결과일 수도 있다.
시험한 설정이 늘어날수록 우연히 뛰어난 백테스트를 고를 위험이 커진다.[S3] 복잡한 모델만의 문제도 아니다. 단순한 이동평균 전략이라도 결과를 보면서 기간과 기준을 계속 바꾸면 과적합될 수 있다.[S3]
이를 줄이려면 처음 세운 가설, 시험한 변수와 설정의 범위, 전체 시도 횟수, 결과를 본 뒤 바꾼 내용, 모델 선택에 쓰지 않은 최종 시험 구간을 기록해야 한다. 좋은 결과 하나만 남기고 실패한 실험을 지우면 그 성과가 얼마나 많은 시도 끝에 선택됐는지 알 수 없다.
3. 시장 변화: 과거의 지도가 현재의 지형은 아니다
모델은 과거 데이터를 압축한 지도와 비슷하다. 하지만 시장 환경과 참여자의 행동은 달라질 수 있다. 과거에 유효했던 관계가 미래에도 같은 강도로 유지된다고 가정할 수 없다.
금융기관을 대상으로 한 모델 위험 관리 지침은 시간외·표본외 평가, 데이터 품질 점검, 지속적인 성능 감시와 필요할 때의 재보정·재개발을 강조한다.[S6] 이 지침이 개인 투자자에게 직접 적용되는 규칙은 아니지만, 그 검증 원칙을 개인 퀀트 연구에 옮기는 것은 유용한 실무적 추론이다.
특정 데이터에서 시장 변화를 탐지하는 단 하나의 최선의 알고리즘은 이번 조사에서 확인되지 않았다. 따라서 체제 전환 감지기 하나를 추가해 문제가 해결됐다고 보기보다 기간별 성과와 예측 오차가 어떻게 변하는지 계속 관찰해야 한다.
4. 거래비용: 화면 속 수익률과 실현 가능한 수익률의 차이
백테스트 화면의 수익률이 실제 계좌의 수익률과 같으려면 거래가 가정한 가격에 비용 없이 체결돼야 한다. 현실에서는 그렇지 않다.
수수료, 매수·매도 호가의 차이와 주문이 가격에 영향을 주는 시장충격은 거래 과정에서 발생하는 비용 항목이다. 회전율은 비용 자체라기보다 자산을 얼마나 자주 교체하는지를 나타내며, 거래 빈도와 전체 비용 규모에 영향을 주는 요소다.[S4]
실제 기관 주문 자료를 분석한 연구에서는 전략별 거래비용과 수용 가능 규모가 달랐고, 비용을 낮추는 실행 설계가 순수익을 바꿀 수 있었다.[S4] 이 결과는 기관투자자의 과거 주문 자료에 기반하므로 개인 투자자나 한국 시장에 그대로 적용할 수는 없다.[S4]
핵심은 거래비용을 넣으면 모든 전략이 실패한다는 것이 아니다. 비용을 넣기 전에는 전략의 실행 가능성을 판단할 수 없다는 것이다.
한국 개인 투자자의 수수료, 세금, 스프레드와 시장충격을 모두 반영한 AI 전략 비교 근거는 이번 조사에서 확보하지 못했다. 후속 실험에서는 대상 시장과 주문 규모를 정한 뒤 그에 맞는 비용 가정을 별도로 고정해야 한다.
5. LLM 환각: 틀린 답도 자신 있게 말한다
LLM은 모든 문장의 사실성을 보장하는 데이터베이스가 아니다. 존재하지 않는 논문, 틀린 수치나 가짜 인용을 자신 있게 제시할 수 있다.[S7]
투자 리서치에서는 추천받은 논문의 존재 여부와 서지정보를 원문에서 확인하고, 공시 요약의 숫자를 원문 표와 대조해야 한다. 계산은 독립적으로 재현하고, 생성된 코드는 작은 표본과 단위 테스트로 검증하며, 답변에 빠진 반대 근거도 별도로 찾아야 한다.
미국 증권 규제기관들은 “손실이 날 수 없는 AI 거래 시스템”이나 “보장된 승자 종목” 같은 표현을 투자 사기의 경고 신호로 제시한다.[S11] AI 기반 자동매매와 성과에 관해 허위·오해 소지가 있는 설명을 했다는 이유로 SEC의 집행 대상이 된 개별 사례도 있다.[S12] 이 사례가 모든 AI 투자 서비스를 부정하는 것은 아니지만, “AI”라는 이름 자체가 신뢰의 증거가 될 수 없다는 점은 보여준다.
앞으로 비교할 네 가지 방법
AI 모델의 가치를 확인하려면 AI 모델끼리만 경쟁시켜서는 안 된다. 복잡한 기술을 사용하지 않는 기준선과 같은 조건에서 비교해야 한다.
1. 매수 후 보유
첫 번째 기준선은 정해진 자산을 매수한 뒤 보유하는 방법이다.
이 기준선은 아무것도 하지 않는 전략이 아니다. 잦은 거래나 모델 유지관리 없이 얻을 수 있는 결과와 복잡한 전략을 비교하는 최소 기준이다. 구체적인 투자대상과 보유 규칙은 실험 전에 고정할 것이다.
2. 단순 모멘텀
두 번째 기준선은 과거 수익률만 사용하는 명시적인 비AI 규칙이다.
Kenneth French Data Library의 일별 모멘텀 팩터는 과거 2~12개월 수익률을 기준으로 구성한 승자 포트폴리오 수익률에서 패자 포트폴리오 수익률을 빼는 방식이다.[S5] 이는 모멘텀을 구현하는 학술적 사례일 뿐, 후속 실험의 규칙을 그대로 정해 주지는 않는다.
실제 실험에서는 대상 시장, 롱온리 여부, 수익률을 측정할 기간, 종목 선택 기준과 리밸런싱 주기를 별도로 사전 고정할 것이다. 미국 학술용 롱숏 팩터의 결과를 개인 투자자나 다른 시장의 성과로 일반화하지도 않을 것이다.[S5]
3. 로지스틱 회귀
세 번째는 다음 기간의 상승 여부를 목표로 하는 단순 머신러닝 기준선인 로지스틱 회귀다.
단순하다는 이유로 성능이 낮다고 미리 가정하지 않는다. 복잡한 모델이 실제로 추가 가치를 제공하는지를 알려면 같은 데이터와 평가 조건에서 비교해야 한다.
4. 트리 계열 모델
네 번째는 변수 사이의 비선형 관계와 상호작용을 포착할 수 있는 트리 계열 모델이다.[S1]
트리 모델은 특정 자산가격 연구에서 가능성을 보였지만, 그 결과가 개인 투자자의 데이터에서도 재현된다고 전제하지는 않는다.[S1] 로지스틱 회귀보다 개선되는지, 개선되더라도 비용과 유지관리 부담을 정당화할 만큼 큰지가 검증 대상이다.
공정한 비교를 위해 미리 고정할 조건
네 방법을 공정하게 비교하려면 모델마다 유리한 시험장을 만들어서는 안 된다. 다음 조건을 가능한 한 사전에 고정해야 한다.
- 투자대상과 종목의 포함·제외 조건
- 각 데이터가 실제로 이용 가능해진 시점
- 학습·검증·최종 시험 기간
- 예측 목표와 보유 기간
- 리밸런싱 빈도
- 진입·청산과 포지션 크기 규칙
- 결측치와 이상값 처리 방식
- 모델별 설정 탐색 범위와 시험 횟수
- 수수료·스프레드·시장충격 가정
- 결과를 채택하거나 기각할 기준
시간 순서가 있는 데이터에서는 과거 구간으로 학습하고 이후 구간에서 평가해야 하며, 최종 평가는 모델 선택에 쓰지 않은 미사용 구간에서 내려야 한다.[S2][S6] 모든 방법에는 동일한 비용 가정을 적용해야 한다.[S4]
평가도 수익률 하나로 끝내지 않을 것이다. 비용 차감 전후 수익률, 변동성, 최대 손실, 회전율과 거래 횟수, 기간별 성과 안정성, 기준선 대비 개선 폭을 함께 기록한다. AI가 연구 과정에 주는 효과는 연구·유지관리 시간, 오류 건수와 수동 수정 횟수처럼 투자성과와 분리된 항목으로 측정한다.
비용, 기간별 안정성과 지속적인 성능 감시를 함께 보자는 것은 거래 실행 및 모델 위험 관리 근거에서 도출한 설계 원칙이다.[S4][S6] 어떤 단일 지표가 모든 전략의 우열을 완벽하게 결정한다고 가정하지는 않는다.
시리즈 전체를 관통할 여덟 가지 질문
결과를 본 다음 유리한 해석 기준을 고르지 않도록, 앞으로 물을 질문을 미리 공개한다.
-
AI 모델은 매수 후 보유와 단순 모멘텀보다 미사용 데이터에서 실제로 나은가? 머신러닝의 가능성은 보고됐지만 단순 기준선을 이긴다는 보장은 없다.[S1][S2][S5]
-
관찰된 차이는 여러 설정을 반복 시험한 뒤 선택한 우연한 승자가 아닌가? 시험 횟수가 늘수록 백테스트 과적합 위험이 커진다.[S3]
-
모든 입력은 예측 시점에 실제로 이용할 수 있었는가? 시간 순서뿐 아니라 데이터 발표 시점과 수정 여부도 별도로 확인해야 한다.[S2][S6]
-
수수료, 스프레드, 시장충격과 회전율을 반영한 뒤에도 개선이 남는가? 비용을 반영하기 전에는 실행 가능성을 판단할 수 없다.[S4]
-
성과가 특정 상승장이나 하락장에만 집중되지는 않았는가? 시장 변화 뒤의 성능 저하를 지속해서 감시할 방법도 필요하다.[S6]
-
LLM이 만든 요약·코드·인용을 원문과 테스트로 확인했는가? 자연스러운 답변은 사실성과 동일하지 않다.[S7][S11]
-
AI가 개선한 것은 정확히 무엇인가? 조사 시간, 오류 건수, 예측 오차와 비용후 위험조정 성과를 서로 다른 지표로 측정해야 한다. 일반 문서 업무에서 관찰된 시간 절약을 투자성과 개선으로 바꾸어 해석해서는 안 된다.[S8][S9]
-
복잡한 모델의 개선 폭이 개발·검증·설명·유지관리 비용을 정당화하는가? 통계적인 개선이 관찰되더라도 지속적인 감시와 재개발 부담까지 고려해야 한다.[S1][S6]
잠정 결론: AI는 판단의 대리인이 아니라 검증을 돕는 도구다
현재 내릴 수 있는 답은 “AI는 조건부로 도움이 될 수 있다” 정도다.
머신러닝은 숫자 데이터에서 조건부 기대수익률이나 위험 프리미엄을 추정하고 자산의 상대적 점수를 계산하는 제한적 도구로 사용할 수 있다.[S1] 생성형 AI는 일반 문서 업무에서 제한적인 시간 절약 가능성을 보였지만, 이를 투자 리서치의 품질이나 수익률 개선으로 해석할 수는 없다.[S9] 금융 텍스트 처리의 가능성과 한계는 별도로 검증해야 하며,[S10] LLM의 핵심 사실·수치·인용은 환각 위험 때문에 원문에서 확인해야 한다.[S7] 코드 설명·작성과 연구 기록 보조의 효용은 아직 확인된 사실이 아니라 후속 실험에서 측정할 가설이다.
일반 프로그램과 공식 API는 데이터 수집과 변경 감시 같은 반복 절차를 자동화할 수 있다.[S8] 그러나 자동화가 투자 판단의 정확성을 보장하지는 않으며, 데이터의 의미와 시점은 사람이 계속 확인해야 한다.
빠르고 그럴듯한 출력이 투자수익 향상을 의미하지도 않는다. 현재 근거만으로는 AI가 자동으로 승자 종목을 골라 주거나 개인 투자자의 장기 수익률을 높인다고 결론 내릴 수 없다. 손실 없는 AI 시스템이나 보장된 승자 종목을 내세우는 표현은 규제기관이 제시한 경고 신호이기도 하다.[S11]
따라서 이 시리즈에서는 AI가 단순한 기준선보다 나은지, 예측 시점에 이용 가능했던 정보만 썼는지, 모델 선택에 쓰지 않은 미래 구간에서도 효과가 유지되는지, 반복 시험으로 고른 우연한 승자는 아닌지, 거래비용 후에도 개선이 남는지를 함께 판단한다. 개선이 확인되더라도 그 폭이 개발·검증·설명·유지관리 부담을 정당화하는지까지 살펴볼 것이다.
이번 편에서는 AI가 맡을 수 있는 역할과 주요 위험을 정리했다. 다음 단계는 멋진 모델을 고르는 일이 아니라 모델을 속이지 않는 시험장을 만드는 일이다. 다음 편에서는 시간 분할, 데이터 누수, 워크포워드 테스트, 반복 탐색 통제와 거래비용 계산을 중심으로 왜 예측보다 검증이 먼저인지 살펴볼 것이다.
AI의 가치는 답변이 얼마나 그럴듯한지가 아니라, 단순 기준선과 같은 조건에서 시간 순서를 지킨 미사용 데이터와 거래비용 반영 후에도 도움이 남는지로 판단할 것이다.[S2][S3][S4]
Sources
- [S1] Empirical Asset Pricing via Machine Learning | National Bureau of Economic Research; Shihao Gu, Bryan Kelly, Dacheng Xiu | 2018-12 발행, 2019-09 개정; 2020년 The Review of Financial Studies 게재 | https://www.nber.org/papers/w25398 ↩
- [S2] TimeSeriesSplit | scikit-learn developers | 현재 안정판 문서; 검색·접근 시 문서에 scikit-learn 1.9.0 표시 | https://scikit-learn.org/stable/modules/generated/sklearn.model_selection.TimeSeriesSplit.html ↩
- [S3] Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance | Notices of the American Mathematical Society; David H. Bailey, Jonathan Borwein, Marcos López de Prado, Qiji Jim Zhu | 2014-04-01 작성, 2014-04-14 최종 개정, 2014-05 게재 | https://papers.ssrn.com/sol3/papers.cfm?abstract_id=2308659 ↩
- [S4] Trading Costs of Asset Pricing Anomalies | Andrea Frazzini, Ronen Israel, Tobias J. Moskowitz; 저자 공개 원고 | 2012-10-23 초고, 2012-12-05 공개 원고; 이후 2018년 Journal of Financial Economics 게재 | https://pages.stern.nyu.edu/~afrazzin/pdf/Trading%20Cost%20of%20Asset%20Pricing%20Anomalies%20-%20Frazzini%2C%20Israel%20and%20Moskowitz.pdf ↩
- [S5] Detail for Daily Momentum Factor (Mom) | Kenneth R. French Data Library, Dartmouth College | 데이터 범위 1926-11-03~2026-06-30; 접근 시점 기준 | https://mba.tuck.dartmouth.edu/pages/faculty/ken.french/Data_Library/det_mom_factor_daily.html ↩
- [S6] Supervisory Letter SR 26-2 on Revised Guidance on Model Risk Management | Board of Governors of the Federal Reserve System | 2026-04-17 | https://www.federalreserve.gov/supervisionreg/srletters/SR2602.pdf ↩
- [S7] Why language models hallucinate | OpenAI; Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang | 2025-09-05 | https://openai.com/index/why-language-models-hallucinate/ ↩
- [S8] EDGAR Application Programming Interfaces (APIs) | U.S. Securities and Exchange Commission | 2024-06-06 게시, 2025-04-08 최종 검토·갱신 | https://www.sec.gov/search-filings/edgar-application-programming-interfaces ↩
- [S9] Shifting Work Patterns with Generative AI | National Bureau of Economic Research; Eleanor Wiske Dillon, Sonia Jaffe, Nicole Immorlica, Christopher T. Stanton | 2025-05-06 원고 | https://www.nber.org/system/files/working_papers/w33795/revisions/w33795.rev1.pdf ↩
- [S10] FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction | Association for Computational Linguistics; Shu et al. | 2026-07 | https://aclanthology.org/2026.acl-long.610/ ↩
- [S11] Artificial Intelligence (AI) and Investment Fraud: Investor Alert | SEC Office of Investor Education and Advocacy, NASAA, FINRA | 2024-01-25 | https://www.investor.gov/introduction-investing/general-resources/news-alerts/alerts-bulletins/investor-alerts/artificial-intelligence-fraud ↩
- [S12] SEC Charges Rimar Capital Entities and Owner Itai Liptz for Defrauding Investors by Making False and Misleading Statements About Use of Artificial Intelligence | U.S. Securities and Exchange Commission | 2024-10-10 발표, 2024-10-11 최종 검토·갱신 | https://www.sec.gov/newsroom/press-releases/2024-167 ↩
오류 제보·의견 보내기
글 제목과 주소가 포함된 메일 초안을 엽니다. 내용과 받는 사람을 확인한 뒤 보내주세요.
받는 사람: [email protected]
메일 앱에서 작성메일 앱이 열리지 않으면 아래 내용을 복사해 평소 쓰는 이메일에 붙여 넣으세요.
관련 글
퀀트·데이터 연구 백테스트 전에 정할 것들: 미국 ETF 퀀트 리서치의 질문과 규칙
첫 미국 ETF 연구를 시작하기 전 질문, 매매 규칙, 기준선과 시간 분할을 고정하는 방법을 다룹니다. 결과를 보기 전에 남겨야 할 연구 계약과 기록을 정리합니다.
AI AI 코딩 에이전트를 잘 쓰는 법: 도구 비교보다 위임 설계
AI 코딩 에이전트의 기능과 통제 장치를 비교하고, 과업 분할부터 검증·승인·복구까지 실무에서 필요한 위임 방식을 정리합니다.