선형 회귀(Linear Regression)를 활용해 모든 거래에서 승리하고, 진짜 알파 시그널(Alpha Signal)을 구축하며, 정확한 수익 코드를 공유하는 방법을 알려드리겠습니다.
바로 본론으로 들어가죠.
이 글을 북마크하세요
- 저는 Roan입니다. 시스템 설계, HFT 스타일 실행, 그리고 퀀트 트레이딩 시스템을 전문으로 하는 백엔드 개발자입니다. 제 작업은 예측 시장이 실제 부하 하에서 어떻게 작동하는지에 초점을 맞추고 있습니다. 제안, 진지한 협업, 파트너십에 관한 모든 문의는 언제든지 DM으로 보내주세요.
모든 퀀트에게는 이런 경험이 있습니다.
일주일 내내 모델 하나에 매달립니다. 백테스트(Backtest)는 완벽해 보이고, 자본 곡선(Equity Curve)은 곧바로 위를 향합니다. 드디어 찾았다고 생각하죠. 실제 운영에 들어갑니다. 2주 후, 손실이 나고 왜 그런지 전혀 알 수가 없습니다.
저는 이 한 사이클이 어떤 시장 붕괴보다 더 많은 퀀트 커리어를 끝내는 것을 목격했습니다. 그 모델은 절대 진짜가 아니었습니다. 시그널( Signal)로 위장한 노이즈(Noise)였죠. 그리고 이 분야 전체에서 가장 가치 있는 기술은 단 1달러도 위험에 빠뜨리기 전에 이 둘을 구별하는 법을 배우는 것입니다.
그 기술은 퀀트 금융(Quantitative Finance)에서 가장 과소평가된 도구에서 시작됩니다.
선형 회귀(Linear Regression).
어색하게 들릴 거라는 걸 압니다. 선형 회귀는 누구나 한 시간 만에 배웠다고 생각하고 넘어가는 그런 것입니다. 하지만 제가 수년간의 경험과 실제 손실을 통해 깨달은 것이 있습니다. 최고의 펀드에서 수십억 달러를 운용하는 사람들은 대부분의 핵심 시그널에 이국적인 딥러닝 괴물들을 사용하지 않습니다. 그들은 선형 회귀를 사용하지만, 대부분의 사람들이 도달하지 못하는 훨씬 더 깊이 이해하고, 대부분의 사람들이 쌓지 못하는 규율을 적용합니다.
역사상 가장 성공적인 트레이딩 조직을 살펴보세요.
Jim Simons는 이 정확한 기반 위에 Renaissance Technologies를 세웠습니다. 그의 Medallion Fund는 1988년부터 2018년까지 연평균 약 66%의 총수익률을 기록했으며, 이는 사상 최고 기록입니다. 그리고 그의 팀에 따르면, 이 펀드는 전체 거래의 약 50.75%에서만 옳았습니다. 수백만 건의 거래에서 이 얇디얇은 우위는 1,000억 달러 이상으로 복리 효과를 냈습니다. 그들은 미래를 예측한 것이 아닙니다. 그들은 노이즈의 바다에서 아주 작고, 진짜이며, 반복 가능한 시그널을 끌어낸 것입니다. 이것이 바로 회귀 분석이 하도록 설계된 일입니다.
현재 약 1,790억 달러를 운용하는 AQR은 회귀 기반 팩터 모델(Factor Model) 위에 제국을 세웠습니다.
PDT Partners는 단 한 해의 손실 없이 수년간 통계적 차익거래(Statistical Arbitrage)를 운영했습니다.
이것이 아무도 가르쳐주지 않은 선형 회귀의 진짜 모습입니다.
이 글을 다 읽을 때쯤이면 선형 회귀가 실제로 무엇인지, 알파(Alpha)가 실제로 의미하는 바가 무엇인지, 실제 코드로 단일 및 다중 팩터 시그널을 처음부터 구축하는 방법, 기관 연구원처럼 회귀 분석 결과를 읽는 방법, 진짜 시그널과 우연을 구별하는 정확한 테스트 방법, 그리고 진짜 시그널조차 결국 사라지는 이유를 이해하게 될 것입니다.
참고: 이 글은 의도적으로 길며, 각 부분은 이전 부분을 기반으로 구성됩니다. 실제 시장에서 살아남는 시그널을 구축하는 데 진지하다면, 모든 단어를 읽으십시오. 마법의 지표를 원한다면, 이 글은 당신을 위한 것이 아닙니다.
파트 1: 선형 회귀가 실제로 의미하는 것

선형 회귀는 모든 데이터 포인트에 동시에 가장 가까운 단일 직선을 찾습니다.
금융은 잠시 잊어버리세요.
선형 회귀는 단지 점들의 구름을 통과하는 최적의 직선을 그리는 수학입니다.
집 크기 대비 집 가격을 그래프로 그리는 것을 상상해보세요. 더 큰 집은 더 비싸므로 점들은 위쪽으로 퍼집니다. 선형 회귀는 모든 점들에 동시에 가장 가까운 하나의 직선을 찾습니다. 새 집의 크기를 입력하면 예상 가격을 읽어낼 수 있습니다. 이것이 전체 아이디어입니다. 입력과 출력 사이의 관계를 학습한 다음 이를 사용하여 예측하는 기계인 셈입니다.
Andrew Ng은 그의 유명한 Stanford 기계 학습 강좌를 이 정확한 집값 예제로 시작합니다. 왜냐하면 그것이 가장 간단한 학습 알고리즘이며 다른 모든 것이 구축되는 기초이기 때문입니다.
이 직선은 여러분이 학교에서 이미 배운 공식을 가집니다:
y = a + b x
여기서 y는 예측하는 값, x는 입력값, b는 기울기(Slope, x가 증가함에 따라 y가 얼마나 가파르게 증가하는지), a는 절편(Intercept, x가 0일 때의 y값)입니다. 최적의 a와 b를 찾는 방법은 OLS(Ordinary Least Squares, 보통 최소 제곱법)입니다. 가능한 모든 직선 중에서 OLS는 직선과 실제 점들 사이의 제곱된 차이의 합을 가능한 한 작게 만드는 직선을 선택합니다. 제곱되므로 위와 아래의 오차가 모두 계산되며, 큰 오차는 작은 오차보다 훨씬 더 큰 불이익을 받습니다.
몇 줄의 코드로 전체를 확인할 수 있습니다:
1import numpy as np2import statsmodels.api as sm34x = np.array([1400, 1600, 1700, 1875, 2350, 2450]) # 집 크기5y = np.array([245, 312, 279, 308, 405, 324]) # 가격 (천 단위)67X = sm.add_constant(x) # 절편 항 'a'를 추가합니다8model = sm.OLS(y, X).fit()9print(model.params) # a와 b 값을 출력합니다
이제 이것을 시장에 적용해보세요. 트레이딩에서 y는 자산의 수익률이 되고, x는 그 수익률을 예측한다고 믿는 팩터(Factor)가 됩니다. 기울기는 해당 팩터에 대한 민감도가 됩니다. 그리고 이 겸손한 절편, a는 퀀트 금융에서 가장 중요한 숫자가 됩니다. 그 이유는 다음과 같습니다.
파트 2: 알파(Alpha)가 실제로 의미하는 것

총 수익률은 시장이 설명하는 부분인 베타(Beta)와 시장이 설명하지 못하는 부분인 알파(Alpha)로 나뉩니다.
대부분의 트레이더는 알파라는 단어를 수익(Profit)이라는 의미로 사용합니다. 그것은 틀렸으며, 그 실수는 대가가 큽니다.
알파는 알려진 위험 팩터( Risk Factor)에 대한 노출로 설명될 수 없는 전략의 수익입니다. 만약 1년에 20%를 벌었지만 시장도 20%를 벌었다면, 당신의 알파는 0입니다. 당신은 단지 베타, 즉 시장 위험을 감수한 대가로 얻는 수익을 보유하고 있었을 뿐입니다. 당신은 실력이 아니라 파도를 탄 대가를 받은 것입니다.
이 구분이 게임의 전부이며, 회귀 분석은 이 둘을 분리하는 칼날입니다. 기본 모델은 다음과 같습니다. 시간 t에서 전략의 수익률을 rₜ라고 할 때, 이는 베이스라인에 팩터 Xₜ에 대한 노출도를 더하고 노이즈를 더한 것입니다:
rₜ = α + β Xₜ + εₜ
천천히 읽어보세요. β는 팩터에 대한 민감도입니다. 팩터가 시장이라면, 베타는 시장이 움직일 때 당신이 얼마나 강하게 움직이는지를 나타냅니다. εₜ는 무작위 노이즈로, 어떤 팩터로도 설명되지 않는 부분입니다. 그리고 α, 절편은 팩터가 아무런 기여를 하지 않을 때 평균적으로 얻는 수익입니다.
그 절편이 바로 전체 상입니다. 알려진 모든 위험 팩터를 제거한 후에도 전략이 여전히 양의, 통계적으로 유의미한 알파를 보여준다면, 당신은 진짜 무언가를 찾은 것입니다. 만약 팩터를 고려하는 순간 알파가 사라진다면, 당신은 절대 우위(Edge)를 가진 적이 없습니다. 당신은 천재로 위장한 베타를 가지고 있었던 것입니다.
Michael Jensen은 1968년에 뮤추얼 펀드 매니저들이 실제로 시장을 이길 수 있는지 테스트하면서 처음으로 실력을 이런 방식으로 정의했습니다. 그는 이 정확한 회귀 분석을 실행하고 한 가지 질문을 던졌습니다. 절편이 0과 다른가? 거의 60년이 지난 지금도 이것은 여전히 기관의 성과를 판단하는 방식입니다. 이것은 Jensen's Alpha라고 불리며, 이 분야의 초석입니다.
따라서 시그널을 구축할 때, 당신의 임무는 절대 원시 수익률을 최대화하는 것이 아닙니다.
당신의 임무는 알려진 팩터들이 사라진 후에도 살아남는 양의 절편을 생산하는 것입니다. 이 점을 명심하세요. 다른 모든 것은 이것을 따릅니다.
파트 3: 처음부터 첫 번째 시그널 구축하기

진짜 시그널은 알려진 모든 팩터가 제거된 후에야 알파를 측정합니다.
가장 간단한 실제 모델을 만든 다음, 기관 수준으로 발전시켜 봅시다. 한 자산의 수익률이 어떤 팩터에 의해 부분적으로 예측될 수 있다고 가정해보세요. 관련 자산의 과거 수익률, 모멘텀(Momentum) 측정치, 가치(Value) 지표 같은 것들입니다. 단일 팩터 회귀는 다음과 같습니다:
rₜ = α + β Xₜ + εₜ
Python에서는 몇 줄이면 되며, 절편은 절대 건너뛰어서는 안 되는 부분입니다:
1import statsmodels.api as sm23# X는 팩터 시리즈, y는 설명하려는 자산 수익률4X = sm.add_constant(X) # THIS 줄이 알파 절편을 생성합니다5model = sm.OLS(y, X).fit()6print(model.summary())
add_constant 라인은 형식적인 것이 아닙니다. 이것은 알파 항을 생성하는 라인입니다. 이것을 잊어버리면 직선이 0을 통과하도록 강제하여 전체 출력에서 가장 중요한 숫자를 버리는 것입니다.
하지만 실제 세계는 결코 단일 팩터가 아닙니다. 진지한 시그널은 한 번에 많은 영향을 고려합니다. 이것이 다중 팩터 모델(Multi-Factor Model)입니다:
rₜ = α + β₁X₁ₜ + β₂X₂ₜ + ... + βₖXₖₜ + εₜ
이제 각 베타는 다른 모든 팩터를 일정하게 유지하면서(holding the others constant) 해당 팩터의 효과를 측정합니다. '다른 모든 팩터를 일정하게 유지한다'는 이 표현은 회귀 분석의 조용한 초능력입니다. 이는 각 팩터의 고유한 기여도를 분리하고 중복을 제거합니다. 전략 수익률을 시장, 규모, 가치, 모멘텀 등 확립된 팩터들에 대해 회귀 분석할 때, 그 절편에 남는 알파는 알려진 어떤 팩터도 설명할 수 없는 당신 우위의 일부입니다.
1import statsmodels.api as sm23# factors는 DataFrame이며, 각 열은 하나의 팩터이고, 수익률 y와 정렬됩니다4X = sm.add_constant(factors)5model = sm.OLS(y, X).fit()67alpha = model.params['const'] # 당신의 후보 우위(Edge)8p_alpha = model.pvalues['const'] # 신뢰도9print("Alpha:", round(alpha, 5))10print("Alpha p-value:", round(p_alpha, 4))
그 잔차 절편(Residual Intercept)이 당신의 후보 시그널입니다. 여기서부터는 그것이 진짜인지 증명하는 과정입니다.
바로 이 지점이 대부분의 공개 튜토리얼이 멈추는 곳이자, 기관의 실제 작업이 시작되는 곳입니다. 팩터 구성(Factor Construction), 중립화(Neutralization), 원시 시그널을 거래 가능한 포트폴리오로 바꾸는 가중치 체계(Weighting Scheme). AQR과 같은 회사가 이러한 회귀 분석을 실제 팩터 포트폴리오로 전환하는 정확한 방법을 알고 싶다면, 그 분석은 제가 모든 과정을 설명하는 곳입니다.
파트 4: 기관 연구원처럼 결과 읽기

전문가는 수익이 얼마나 큰지 묻지 않습니다. 그것이 우연이 아니라는 확신이 얼마나 되는지 묻습니다.
요약(Summary)을 실행할 때, 대부분의 사람들은 하나의 숫자만 보고 넘어갑니다. 훈련된 연구원은 그것을 진단 보고서처럼 읽습니다. 실제로 중요한 것은 다음과 같습니다.
계수(Coefficient)와 그 부호(Sign). 각 베타는 방향과 강도를 제공합니다. 어떤 숫자든 신뢰하기 전에, 그 부호가 경제적으로 말이 되는지 물어보십시오. 모델이 어떤 것이 더 비쌀 때 매수하라고 말하는데 그 이유를 설명할 수 없다면, 당신은 팩터가 아닌 우연을 찾은 것입니다.
p-값(P-value). 이것이 모든 것의 핵심입니다. 그것은 한 가지 질문에 답합니다. 이 팩터가 실제로 효과가 전혀 없다면, 순전히 우연에 의해 이렇게 강력한 관계를 보게 될 가능성은 얼마나 될까요? p-값이 0.62라는 것은 당신이 무작위 운을 보고 있을 확률이 62%라는 의미입니다. 0.05 미만이 결과를 진지하게 받아들이는 일반적인 기준입니다. p-값이 0.62인 실패한 모델을 보는 퀀트는 약한 시그널을 보고 있는 것이 아닙니다. 그는 순수한 노이즈를 보고 있는 것입니다.
R-제곱(R-squared). 모델이 설명하는 수익률 변동의 비율입니다. 그리고 여기 초보자들을 혼란스럽게 하는 부분이 있습니다. 수익률 예측에서 높은 R-제곱은 일반적으로 트로피가 아니라 경고입니다. 실제 수익 시그널은 약합니다. R-제곱이 0.01 또는 0.02라도 지속적이고 진짜라면 엄청난 수익을 낼 수 있습니다. 수익률 예측에서 0.9를 본다면 거의 확실하게 선견지명 편향(Look-Ahead Bias)이 있거나 실수로 무언가를 자기 자신에 대해 회귀 분석하고 있는 것입니다.
t-통계량(t-statistic). 계수를 표준 오차(Standard Error)로 나눈 값입니다. 대략적인 규칙은 절대값이 2 이상인 t-통계량이 0.05 임계값과 일치한다는 것입니다. 진지한 연구자들은 새로운 시그널에 대해 3 이상을 요구합니다. 왜냐하면 그 전에 얼마나 많은 시그널을 조용히 테스트했는지 알기 때문입니다.
전체 테이블을 읽는 대신 이 값들을 직접 추출할 수 있습니다:
1print("t-stats:\n", model.tvalues)2print("p-values:\n", model.pvalues)3print("R-squared:", round(model.rsquared, 4))
이 사고의 전환을 내면화하세요. 초보자는 수익이 얼마나 큰지 묻습니다. 전문가는 이 수익이 우연이 아닐 확신이 얼마나 되는지 묻습니다. 질문의 이 하나의 변화가 모든 차이를 만듭니다.
파트 5: 진짜 시그널과 노이즈를 구별하는 테스트, 그리고 시그널이 사라지는 이유

모든 후보를 동일한 관문(Gauntlet)에 통과시키세요. 거의 아무것도 살아남지 못하며, 그것이 바로 요점입니다.
냉혹한 진실은 이것입니다. 충분히 많은 무작위 시그널을 테스트하면, 일부는 순전한 우연으로 수익성이 있어 보일 것입니다. 0.05 수준에서 쓸모없는 시그널 100개를 테스트하면 약 5개가 운만으로 통과할 것입니다. 이것이 다중 테스트 문제(Multiple Testing Problem)이며, 백테스트가 거짓말을 하는 가장 큰 이유입니다. 진지한 데스크(Desk)가 이를 방어하는 방법은 다음과 같습니다.
표본 외 검증(Out-of-Sample Testing). 절대 모델을 구축한 데이터로 시그널을 판단하지 마십시오. 데이터를 분할하세요. 처음 부분으로 모델을 구축하고, 모델이 한 번도 보지 못한 부분에서 테스트하세요. 진짜 시그널은 교차점(Crossing)에서 살아남습니다. 맞춰진 환상(Fitted Fantasy)은 신선한 데이터를 만나는 순간 붕괴합니다. 타협 불가입니다.
1split = int(len(y) * 0.8)2X_train, X_test = X[:split], X[split:]3y_train, y_test = y[:split], y[split:]45model = sm.OLS(y_train, X_train).fit()6oos_pred = model.predict(X_test) # 보지 못한 데이터로 테스트
정보 계수(Information Coefficient, IC). 기관 팩터 연구원들은 단일 회귀 분석에 목숨을 걸지 않습니다. 그들은 IC, 즉 팩터 값과 실제 미래 수익률 간의 상관 관계를 시간이 지남에 따라 반복해서 계산합니다. 평균 IC가 약 0.03~0.05 이상이고 여러 기간에 걸쳐 안정적으로 유지되는 팩터는 단 하나의 화려한 백테스트를 가진 팩터보다 항상 우위에 있습니다. 여러 상황(Regime)에 걸친 안정성이 진짜 신호입니다.
Newey-West 표준 오차. 금융 데이터는 수익률과 변동성이 시간에 따라 군집(Cluster)되기 때문에 핵심 OLS 가정을 위반합니다. 원시 p-값은 거짓말을 하며, 일반적으로 당신의 시그널을 좋게 보이게 만듭니다. Newey-West는 이에 대해 표준 오차를 수정합니다. 이것을 사용하는 것은 자신이 무엇을 하고 있는지 아는 사람이라는 조용한 신호입니다.
1# Newey-West 수정 유의성, 기관의 기본값2model = sm.OLS(y, X).fit(cov_type='HAC', cov_kwds={'maxlags': 5})3print(model.summary())
다중 테스트 보정(Multiple Testing Correction). 50개의 시그널을 시도했다면 일반적인 기준으로 승자를 판단할 수 없습니다. 간단한 방어는 Bonferroni로, 테스트한 항목 수로 임계값을 나누는 것입니다. 50개의 시그널을 시도했다면? 0.05가 아닌 0.001 미만의 p-값을 요구하세요. 엄격하며,それが 바로 요점입니다. 그것은 얼마나 많이 시도했는지에 대한 정직함을 강요합니다.
후보를 표본 외 검증(Out-of-Sample Validation), 안정적인 IC, Newey-West 유의성, 다중 테스트 보정에 통과시키고, 여전히 살아남았다면, 당신은 대부분의 소매 트레이더가 평생 만들어내지 못하는 무언가를 가진 것입니다. 진정으로 신뢰할 자격을 얻은 시그널입니다.
하지만 마지막 진실을 이해하세요. 진짜 시그널조차도 붕괴합니다. 알파는 시장 비효율성(Market Inefficiency)에 존재하며, 시그널이 알려지고 거래되는 순간, 거래 자체가 비효율성을 밀어내기 때문입니다. 최근 팩터 군집(Factor Crowding)에 대한 연구는 단순 모멘텀과 같이 기계적이고 쉽게 복제 가능한 시그널이 자본이 쌓임에 따라 날카롭고 예측 가능한 곡선을 따라 붕괴하며, ETF를 통한 팩터 투자가 저렴해지면서 이러한 군집 현상이 급격히 가속화되었음을 보여줍니다. 가장 간단한 시그널이 가장 군집화되고 가장 빨리 죽습니다. 지속 가능한 우위는 구축하는 데 진정한 노력이 필요한 시그널, 그리고 오래된 시그널이 침식되는 것보다 더 빨리 새로운 시그널을 생산하는 연구 프로세스에 존재합니다. 이것이 Renaissance가 30년 동안 단 하루도 연구를 멈추지 않은 이유입니다.
숙제: 현재 믿고 있는 시그널을 하나 가져오세요. 데이터의 가장 최근 20%에 대해 실행해보세요. 당신은 그 데이터를 한 번도 본 적이 없다고 가정할 것입니다. 알파가 사라진다면, 방금 진짜 돈을 절약한 것입니다. 그것은 당신이 실행할 가장 가치 있는 테스트가 될 것입니다.
파트 6: 방금 구축한 것, 처음부터 끝까지

모든 진짜 시그널은 군집화됨에 따라 침식됩니다. 그것들을 대체하는 연구 엔진이 실제 우위입니다.
한 걸음 물러서서 당신이 지금 가진 전체 기계를 살펴보세요. 각 조각들이 연결되어 하나의 깔끔한 파이프라인을 형성하기 때문입니다.
팩터, 즉 미래 수익률에 대한 정보를 담고 있다고 믿는 무엇이든지로 시작합니다. OLS를 사용하여 자산의 수익률을 해당 팩터에 대해 회귀 분석하며, 항상 절편을 포함시킵니다. 그 절편이 당신의 후보 알파입니다. 다중 팩터 회귀 분석으로 확장하여 당신의 알파가 시장, 규모, 가치, 모멘텀과 같은 알려진 위험 팩터를 제거한 후에만 측정되도록 합니다. 절편에 남는 것은 순수하고 설명되지 않은 우위입니다.
그런 다음 그것을 심문합니다. p-값을 읽어 그것이 운일 가능성이 있는지 묻습니다. 부호가 경제적으로 타당한지 확인합니다. 매혹적인 높은 R-제곱은 무시하고 작지만 정직한 R-제곱을 존중합니다. 모델이 전혀 접촉하지 않은 데이터로 표본 외 검증을 수행합니다. 여러 기간에 걸쳐 정보 계수(IC)를 계산하여 그것이 일회성 우연이 아니라 안정적임을 확인합니다. Newey-West로 표준 오차를 수정하여 시장의 시간 구조가 당신을 속이지 못하게 합니다. 그리고 다중 테스트 보정을 적용하여 당신이 시도한 시그널의 수가 가짜 승자를 만들어낼 수 없도록 합니다.
반대편에서 나오는 것은 추측이 아닙니다. 그것은 측정된 우위, 알려진 신뢰 수준, 보지 못한 데이터에서 살아남는다는 증거, 그리고 그것이 진짜일 가능성에 대한 정직한 평가를 가진 시그널입니다. 이것이 2주 만에 모델이 죽는 사람과 지속되는 무언가를 구축하는 사람의 차이입니다.
그리고 그것이 실제로 돈을 버는 방법은 다음과 같습니다. 작지만 진정하고 안정적인 우위를 가진 시그널을 많은 독립적인 기회에 걸쳐 거래하면 복리 효과가 발생합니다. Renaissance는 절반보다 조금 더 많은 시간 동안 옳았을 뿐이며, 그것을 시장 역사상 가장 큰 부로 전환했습니다. 우위가 진짜였고, 반복 가능했으며, 엄청난 수의 베팅에 걸쳐 올바르게 크기를 조정했기 때문입니다. 당신은 이제 동일한 청사진으로 작업하고 있습니다. 시그널을 구축하고, 그것이 진짜임을 증명하고, 합리적으로 크기를 조정하고, IC가 희미해지기 시작하는 즉시 교체하십시오.
그 교체 루프가 전체 커리어입니다. 하나의 시그널은 하나의 거래입니다. 그것들이 침식되는 것보다 더 빨리 진짜 시그널을 계속 생산하는 연구 프로세스는 프랜차이즈(Franchise)입니다.
요약
선형 회귀는 당신이 건너뛴 지루한 도구가 아닙니다. 그것은 데이터를 통과하는 최적의 직선을 그리고, 알파가 실제로 무엇인지 정의하고, 첫 번째 실제 시그널을 구축하고, 그 시그널이 진짜인지 노이즈인지 테스트하며, 시그널이 죽기 시작할 때 당신에게 경고합니다.
알파는 알려진 모든 위험 팩터가 제거된 후에 살아남는 절편입니다. 먼저 단일 팩터, 그 다음 다중 팩터로 OLS를 사용하여 후보를 구축합니다. 연구원처럼 출력을 읽습니다. 여기서 p-값과 안정성이 수익의 크기보다 더 중요합니다. 표본 외 검증, 안정적인 정보 계수(IC), Newey-West 오차, 그리고 시도한 시그널 수에 대한 보정을 통해 다중 테스트 함정을 방어합니다. 그리고 모든 진짜 시그널은 결국 붕괴한다는 것을 받아들입니다. 이는 진정한 우위가 단일 모델이 아니라 연구 엔진임을 의미합니다. 역사상 가장 위대한 펀드를 만든 바로 그 엔진 말입니다.
샤프 비율(Sharpe) 0.03과 p-값 0.62를 바라보는 퀀트는 운이 나쁜 것이 아닙니다. 그는 이 글에 담긴 규율을 건너뛴 것입니다. 그렇게 되지 마십시오.
여기 당신이 곰곰이 생각해보길 바라는 질문이 있습니다.
진짜 알파가 널리 알려지는 순간 붕괴된다면, 시그널을 공개하는 것은 그것을 파괴하는 반면, 시그널을 숨기는 것은 다른 사람들이 독립적으로 발견함에 따라 여전히 서서히 죽어간다는 의미입니다.
그렇다면 지속 가능한 우위는 실제로 어디에서 오는 것일까요? 시그널 자체일까요, 아니면 그것을 대체하는 연구 프로세스의 속도일까요?
당신의 답변은 당신이 한 번의 큰 승리를 쫓는 트레이더처럼 생각하는지, 아니면 수십 년 동안 우위를 생산하는 기계를 구축하는 퀀트처럼 생각하는지를 드러낼 것입니다.
댓글에 답변을 남겨주세요. 틀린 답변은 없습니다. 하지만 매우 많은 것을 드러내는 답변은 있습니다.





