머신러닝 모형은 선형 회귀보다 복잡한 관계를 표현할 수 있습니다. 모멘텀이 강하면서 변동성이 낮고 거래대금이 충분한 종목처럼 여러 조건의 조합도 트리 구조로 나눌 수 있습니다.
표현력이 높다는 사실이 미래 수익률을 더 잘 예측한다는 보장은 아닙니다. 짧은 주식 표본에서는 복잡한 모형이 과거 잡음까지 학습할 수 있고, 예측 오차가 조금 줄어도 실제 포트폴리오 순위와 비용 후 수익은 나아지지 않을 수 있습니다.
Gu·Kelly·Xiu는 2020년 논문에서 약 3만 개 미국 주식과 900개가 넘는 입력 신호를 이용해 선형 회귀, 축소 모형, 트리와 신경망을 같은 표본 밖 조건에서 비교했습니다. 비선형 상호작용을 허용한 트리와 신경망이 전통적 회귀보다 높은 예측력과 포트폴리오 성과를 보였습니다.
같은 질문을 국내 시가총액 상위 300개 연간 표본과 가격 기반 특성 10개로 축약했습니다. 2011~2015년을 최초 학습에 사용하고 2016년부터는 매년 이전 연도까지만 다시 학습해 다음 해를 예측했습니다.
결과는 원 논문과 달랐습니다. 그래디언트 부스팅 트리의 개별 종목 표본 밖 R²는 -0.11%로 Ridge 선형모형의 -0.15%보다 조금 높았지만 둘 다 0을 넘지 못했습니다. 월평균 종목 순위상관과 롱·숏 수익은 오히려 Ridge가 높았고, 편도비용 0.30% 뒤에는 두 전략 모두 음수가 됐습니다.
이 글의 핵심 결론
- 트리의 표본 밖 R² -0.11%는 Ridge의 -0.15%보다 높았지만, 두 모형 모두 0% 예측보다 오차가 컸습니다.
- 월평균 순위상관은 Ridge 1.64%, 트리 1.21%였고 트리의 비선형성이 종목 순위를 개선하지 못했습니다.
- 예측 상·하위 20% 스프레드의 연율화 평균은 Ridge +0.83%, 트리 -0.40%로 모두 강한 경제적 성과가 아니었습니다.
- 작은 예측 오차 개선과 거래 가능한 비용 후 수익은 별도의 검증입니다.
어떤 논문인가
- 저자: Shihao Gu, Bryan Kelly, Dacheng Xiu
- 제목: 「Empirical Asset Pricing via Machine Learning」
- 저널: The Review of Financial Studies, 33권 5호, 2020년
- 표본: 약 3만 개 미국 주식, 1957~2016년
- 핵심 방법: 선형·축소·차원축소·트리·신경망의 표본 밖 수익률 예측과 포트폴리오 비교
- DOI: 10.1093/rfs/hhaa009
논문의 예측 대상은 다음 달 개별 주식의 기대 초과수익률입니다. 수익률의 경제적 원인을 하나로 확정하기보다, 과거에 알 수 있었던 많은 특성으로 조건부 기대수익을 얼마나 정확히 측정할 수 있는지 비교했습니다.
머신러닝의 역할도 상승·하락을 완벽히 맞히는 인공지능과 다릅니다. 개별 종목의 작은 기대수익 차이를 추정해 상대적으로 높은 종목과 낮은 종목을 정렬하는 문제입니다.
원 논문은 900개가 넘는 입력을 같은 조건에서 비교했습니다
연구진은 주식별 특성 94개를 사용했습니다. 각 특성을 거시 시계열 변수 8개와 결합하고 산업 더미 74개를 더해 기본 입력이 900개를 넘었습니다.
비교한 모형도 한 종류가 아니었습니다.
- 전체·축소 OLS와 Elastic Net
- 주성분회귀와 부분최소제곱
- 일반화 선형모형
- 랜덤 포레스트와 그래디언트 부스팅 트리
- 은닉층 1~5개의 신경망
훈련 손실만 비교하지 않고 미사용 기간의 개별 종목 수익률 예측 오차와 예측값으로 만든 포트폴리오를 함께 평가했습니다. 입력 수가 많은 전체 OLS가 과적합되는 문제도 축소와 차원축소 모형으로 구분했습니다.
복잡한 전체 OLS는 오히려 표본 밖에서 무너졌습니다
원 논문의 대표 결과에서 규모·가치·모멘텀 세 특성만 사용한 OLS의 월별 개별 종목 표본 밖 R²는 0.16%였습니다. 900개가 넘는 입력을 정규화 없이 모두 넣은 OLS는 -3.46%로 크게 낮아졌습니다.
입력이 많다고 예측력이 자동으로 높아지지 않았습니다. Elastic Net은 0.11%, 주성분회귀와 부분최소제곱은 0.26%와 0.27%로 양수를 회복했습니다.
트리와 신경망은 약 0.33~0.40%로 더 높았습니다. 연구진은 개별 특성의 비선형 변환보다 여러 특성 사이의 상호작용을 표현한 점이 개선의 중요한 원인이라고 해석했습니다.
0.4%는 작아 보이지만 개별 월수익률의 잡음이 매우 크다는 점을 감안해야 합니다. 원 논문에서도 개별 종목보다 포트폴리오로 묶었을 때 예측 신호가 더 선명했습니다.
원 논문에서는 포트폴리오 성과 차이도 컸습니다
예측값 상·하위 10%를 가치가중한 롱·숏 포트폴리오에서 신경망의 연율화 표본 밖 Sharpe는 1.35였습니다. 단순 OLS 기준 모형은 0.61이었습니다.
동일가중에서는 신경망 2.45, OLS 0.83으로 차이가 더 컸습니다. 다만 동일가중 결과는 작은 종목의 영향과 실제 거래비용에 더 민감할 수 있습니다.
모형들이 중요하다고 본 특성의 큰 분류는 비슷했습니다.
- 모멘텀·단기 반전 같은 가격 추세
- 시가총액·거래대금·호가 스프레드 같은 유동성
- 전체·고유 변동성과 시장 베타
논문은 높은 예측력이 경제적 인과관계를 자동으로 식별하지는 않는다고 구분했습니다. 예측 모형은 기대수익 측정 도구이고, 왜 그 관계가 존재하는지는 별도의 경제 구조가 필요합니다.
이번 글은 가격 기반 특성 10개만 사용했습니다
원문의 재무제표·산업·거시 특성을 확보하지 못했으므로 같은 예측 문제를 작은 범위로 줄였습니다.
| 분류 | 사용한 특성 |
|---|---|
| 가격 추세 | 1·3·6개월 수익률, 12-1개월 모멘텀 |
| 규모·유동성 | 시가총액, 최근 20일 거래대금 중앙값, 가격 수준 |
| 위험 | 시장 베타, 전체 변동성, 시장 회귀 잔차 변동성 |
모든 특성은 매월 종목 사이의 백분위 순위로 바꿔 -1에서 1 사이에 놓았습니다. 신규 상장처럼 과거 기간이 부족한 값은 그달의 중립 순위 0으로 처리했습니다.
목표값은 다음 한 달 수정주가 수익률입니다. 학습 자료의 극단 0.5%는 경계값으로 제한했지만 표본 밖 실제 수익률은 자르지 않았습니다.
선형 Ridge와 부스팅 트리를 고정해 비교했습니다
선형모형은 계수 크기를 줄이는 Ridge를 사용했습니다. 같은 특성의 효과가 다른 특성과 무관하게 더해지는 구조입니다.
비선형모형은 깊이 3의 그래디언트 부스팅 회귀 트리를 사용했습니다. 여러 얕은 트리를 순차적으로 더해 특성의 문턱과 상호작용을 표현합니다.
원문처럼 여러 선형·트리·신경망 구조와 대규모 변수 선택을 수행하지 않았습니다. 두 모형의 차이를 이해하기 위한 축약 비교입니다.
| 항목 | 조건 |
|---|---|
| 종목 표본 | 전년도 말 시가총액 상위 300개를 다음 해에 고정 |
| 최초 학습 | 2011~2015년 |
| 표본 밖 예측 | 2016~2025년, 31,543개 종목·월 관측 |
| 재학습 | 매년 이전 연도까지 확장해 다시 학습 |
| 선형모형 | Ridge, 축소 강도 고정 |
| 비선형모형 | 깊이 3·최대 150회 부스팅 트리 |
| 포트폴리오 | 예측 상위 20% 매수·하위 20% 공매도, 가치가중 |
| 비용 | 편도 0%·0.10%·0.30% |
각 해의 예측 모형은 그해 수익률을 보지 않고 만들어졌습니다. 2018년 예측에는 2017년까지, 2025년 예측에는 2024년까지의 자료만 사용했습니다.
전진분석으로 학습과 평가를 분리하는 방법과 같은 시간 순서를 적용했지만, 변수 선택과 초매개변수를 매년 다시 최적화하지 않고 처음 정한 값을 유지했습니다.

두 모형 모두 개별 종목 표본 밖 R²가 음수였습니다
표본 밖 R²는 모든 종목의 다음 달 수익률을 0으로 예측했을 때의 제곱오차를 기준으로 계산했습니다.
| 모형 | 개별 종목 OOS R² | 월평균 순위 IC | 순위 IC Newey–West t값 |
|---|---|---|---|
| Ridge 선형 | -0.15% | +1.64% | 1.98 |
| 부스팅 트리 | -0.11% | +1.21% | 1.57 |
트리의 R²는 Ridge보다 0.04%포인트 높았습니다. 그러나 둘 다 음수이므로 수익률을 모두 0으로 예측한 기준보다 제곱오차가 작지 않았습니다.
Ridge의 월평균 순위상관은 1.64%로 트리의 1.21%보다 높았습니다. Ridge t값 1.98은 1.96을 조금 넘었지만, 모형과 지표를 여러 방식으로 확인한 선택 문제와 비용을 반영한 결과는 아닙니다.
트리는 오차가 큰 일부 종목의 예측을 줄여 전체 제곱오차를 조금 개선할 수 있습니다. 하지만 투자에 필요한 상·하위 종목 순서를 더 잘 맞혔다고 볼 수는 없었습니다.
예측 오차가 덜 나빴던 트리의 포트폴리오 수익은 더 낮았습니다
매월 예측 상위 20%를 매수하고 하위 20%를 공매도한 가치가중 스프레드입니다.
| 모형 | 비용 전 연율화 평균 | Newey–West t값 | Sharpe | MDD | 한쪽 월회전율 |
|---|---|---|---|---|---|
| Ridge 선형 | +0.83% | 0.19 | 0.05 | -42.27% | 42.4% |
| 부스팅 트리 | -0.40% | -0.08 | -0.02 | -44.22% | 41.7% |
Ridge의 양의 평균도 t값 0.19와 Sharpe 0.05에 그쳤습니다. 트리는 비용 전부터 음수였습니다.
개별 종목 R²는 모든 예측 오차의 크기를 보고, 롱·숏 포트폴리오는 예측 분포의 양끝과 가치가중 순서를 봅니다. 목적함수가 다르므로 R²가 조금 높은 모형이 반드시 더 높은 전략 수익을 내지 않습니다.
Fama–French 요인과 알파를 분리한 검증처럼 통계 모형의 설명력과 경제적 초과성과는 같은 숫자가 아닙니다.
연도별 결과는 한 방향으로 유지되지 않았습니다
Ridge 스프레드는 2016년 +6.5%, 2017년 -18.5%, 2019년 -15.0%, 2022년 +10.6%, 2025년 +10.8%의 연율화 월평균을 기록했습니다.
트리는 2016년 -23.4%, 2018년 +19.0%, 2019년 -26.3%, 2024년 +25.2%, 2025년 -5.2%였습니다. 전체 평균 하나로는 큰 방향 전환을 볼 수 없습니다.
표본 밖 구간 안에서도 특정 해의 큰 수익과 손실이 반복됐습니다. 한 번의 워크포워드 평균이 양수였다는 사실만으로 안정적인 기대수익 함수를 찾았다고 말하기 어렵습니다.
편도비용 0.10%부터 두 전략 모두 음수가 됐습니다
| 모형 | 비용 전 연율화 평균 | 편도 0.10% 후 | 편도 0.30% 후 | 편도 0.30% 후 Sharpe |
|---|---|---|---|---|
| Ridge 선형 | +0.83% | -0.20% | -2.26% | -0.13 |
| 부스팅 트리 | -0.40% | -1.41% | -3.43% | -0.21 |
두 포트폴리오의 한쪽 월회전율은 약 42%였습니다. 예측값이 조금씩 바뀌면서 상·하위 20% 경계의 종목이 계속 교체됐습니다.
이상현상과 거래비용을 비교한 결과처럼 예측력이 약한 전략에서는 편도 0.10%도 결론을 바꿀 수 있습니다. 머신러닝이라는 이름이 거래비용을 줄여주지는 않습니다.
실제 공매도 대차 비용과 시장충격까지 넣으면 순성과는 더 낮아질 수 있습니다.
트리는 변동성·가격·규모 특성을 많이 사용했습니다
각 예측 연도에서 특성 하나를 섞었을 때 제곱오차가 얼마나 나빠지는지 확인하고 중요도를 합이 100%가 되도록 정규화했습니다.
| 트리 특성 | 연도별 순열 중요도 평균 |
|---|---|
| 고유 변동성 | 18.2% |
| 가격 수준 | 13.3% |
| 전체 변동성 | 12.9% |
| 시가총액 | 11.3% |
| 6개월 수익률 | 10.1% |
| 3개월 수익률 | 9.7% |
| 12-1개월 모멘텀 | 8.4% |
변동성·규모와 가격 추세가 중요했다는 큰 분류는 원 논문의 결과와 닮았습니다. 그러나 중요도는 인과관계나 양의 방향을 의미하지 않습니다.
상관된 특성 가운데 하나를 섞으면 다른 특성이 대신 설명할 수 있고, 해마다 학습 표본이 바뀌므로 중요도도 달라집니다. 무엇보다 이 특성을 많이 사용한 트리의 비용 전 포트폴리오 성과가 양수는 아니었습니다.
원 논문과 다른 결과가 나온 이유를 분리해야 합니다
원 논문은 60년, 약 3만 종목과 94개 특성·거시 상호작용·산업 정보를 사용했습니다. 이번 표본은 15년, 연간 상위 300개 종목과 가격 기반 특성 10개입니다.
원 논문의 가장 좋은 신경망과 동일한 모형도 사용하지 않았습니다. 그래디언트 부스팅 트리 하나와 Ridge 하나를 고정했으므로 한국 시장에서는 모든 머신러닝이 실패한다고 일반화할 수 없습니다.
반대로 데이터가 작고 입력이 제한된 상황에서 원 논문의 모형 이름만 가져온다고 같은 결과가 나올 이유도 없습니다. 비선형 상호작용은 충분한 표본과 실제 예측 신호가 있을 때만 도움이 됩니다.
데이터 스누핑과 홀드아웃을 비교한 글처럼 모형 수와 초매개변수를 반복해서 바꾼 뒤 가장 좋은 결과만 남기면 이 표본 밖 구간도 다시 탐색 자료가 됩니다.
이번 검증이 알려주지 못하는 것
첫째, 재무제표·산업·거시 특성이 빠졌습니다. 원 논문의 정보 집합을 대표하지 않으며 가격 기반 작은 모형 비교입니다.
둘째, Ridge 축소 강도와 트리 깊이·학습 횟수를 하나로 고정했습니다. 더 나은 초매개변수가 존재할 수 있지만, 같은 자료에서 반복 선택하면 별도의 중첩 검증이 필요합니다.
셋째, 2016~2025년은 한 번의 역사적 표본 밖 구간입니다. 다른 시장과 기간에서 결과가 유지되는지 확인하지 않았습니다.
넷째, 상위 300개 연간 표본은 작은 종목의 강한 예측 신호와 높은 거래비용을 함께 제외할 수 있습니다. 원 논문의 전체 미국 주식 표본과 직접 비교할 수 없습니다.
복잡한 모형은 더 엄격한 표본 밖 검증이 필요합니다
부스팅 트리는 Ridge보다 개별 종목 제곱오차가 조금 작았지만 두 모형의 표본 밖 R²는 모두 음수였습니다. 종목 순위와 롱·숏 수익은 Ridge가 높았지만 Ridge의 비용 전 Sharpe도 0.05에 그쳤습니다.
편도비용 0.30%를 적용하면 연율화 평균은 Ridge -2.26%, 트리 -3.43%였습니다. 예측 오차의 작은 차이가 비용 후 운용 성과로 이어지지 않았습니다.
머신러닝을 평가할 때는 학습 적합도보다 시간 순서를 지킨 표본 밖 R², 종목 순위, 포트폴리오 성과와 거래비용을 차례로 확인해야 합니다. 복잡성은 가능성을 넓히지만 증거를 대신하지 않습니다.
참고 자료
- Gu·Kelly·Xiu, 원 논문 — The Review of Financial Studies의 공개 논문과 서지정보
- 저자 공개 원문 — 모형, 표본 밖 검증과 포트폴리오 결과
이 글은 국내 가격 기반 특성으로 머신러닝 자산가격 예측을 확인한 축약 실험과 한국 시장 확장입니다. 특정 모형의 미래 수익을 보장하거나 매수·매도를 추천하지 않으며, 실제 투자 판단과 책임은 투자자 본인에게 있습니다.