Come utilizzare la regressione lineare per creare segnali Alpha (Framework Quantitativo)

@RohOnChain
INGLESE2 mesi fa · 08 giu 2026
475K
339
30
23
824

TL;DR

Questa guida analizza l'approccio istituzionale alla regressione lineare nel trading, spiegando come isolare l'alpha dal beta, convalidare i segnali utilizzando i p-value e difendersi dal rumore con test out-of-sample.

Sto per spiegarti come usare la regressione lineare per vincere ogni singola operazione, costruire un vero segnale alpha e condividere il codice vincente esatto.

Andiamo dritti al punto.

Segna questa pagina

- Sono Roan, uno sviluppatore backend specializzato in system design, esecuzione in stile HFT e sistemi di trading quantitativo. Il mio lavoro si concentra su come si comportano effettivamente i mercati di previsione sotto carico. Per qualsiasi suggerimento, collaborazioni ponderate o partnership, i DM sono aperti.

Ogni quant ha una versione di questa storia.

Passi una settimana su un modello. Il backtest sembra perfetto, la curva di equity punta dritta verso l'alto e pensi di aver finalmente trovato la soluzione. Vai in produzione. Due settimane dopo sei in perdita e non hai idea del perché.

Ho visto questo ciclo porre fine a più carriere da quant di qualsiasi crollo di mercato. Il modello non è mai stato reale. Era rumore travestito da segnale. E la competenza più preziosa in tutto questo campo è imparare a distinguerli prima di rischiare un solo dollaro.

Quella competenza inizia con lo strumento più sottovalutato della finanza quantitativa.

La regressione lineare.

So cosa stai pensando. La regressione lineare è quella cosa che tutti credono di aver imparato in un pomeriggio e di aver superato. Ma ecco cosa mi è costato anni e perdite reali per capire. Le persone che gestiscono miliardi nelle migliori aziende non usano mostri esotici di deep learning per la maggior parte dei loro segnali principali. Usano la regressione lineare, compresa molto più a fondo di quanto la maggior parte delle persone arrivi mai a fare, applicata con una disciplina che la maggior parte delle persone non costruisce mai.

Guarda l'operazione di trading di maggior successo della storia.

Jim Simons ha costruito Renaissance Technologies su questa esatta fondamenta. Il suo Medallion Fund ha registrato una media di circa il 66% di rendimenti annui lordi dal 1988 al 2018, il miglior record mai registrato. E secondo lo stesso team, il fondo aveva ragione solo su circa il 50,75% delle sue operazioni. In milioni di operazioni, quel margine sottilissimo si è trasformato in più di 100 miliardi di dollari. Non stavano prevedendo il futuro. Stavano estraendo un segnale minuscolo, reale e ripetibile da un oceano di rumore, che è esattamente ciò che la regressione è costruita per fare.

AQR, che ora gestisce circa 179 miliardi di dollari, ha costruito il suo impero su modelli fattoriali basati sulla regressione.

PDT Partners ha gestito l'arbitraggio statistico per anni senza un solo anno in perdita.

Questa è la versione della regressione lineare che nessuno ti ha mai insegnato.

Alla fine di questo articolo capirai cos'è realmente la regressione lineare, cosa significa veramente alpha, come costruire un segnale a singolo e multiplo fattore da zero con codice reale, come leggere un output di regressione come un ricercatore istituzionale, i test esatti che separano un segnale reale da una coincidenza e perché anche un segnale reale alla fine muore.

Nota: Questo articolo è volutamente lungo e ogni parte si basa sulla precedente. Se sei seriamente intenzionato a costruire segnali che sopravvivono ai mercati reali, leggi ogni singola parola. Se vuoi un indicatore magico, questo non fa per te.

Parte 1: Cos'è Realmente la Regressione Lineare

Roan - inline image

La regressione lineare trova l'unica linea retta che si trova più vicina a tutti i punti dati contemporaneamente.

Dimentica la finanza per un secondo.

La regressione lineare è semplicemente la matematica per tracciare la migliore linea retta attraverso una nuvola di punti.

Immagina di tracciare la dimensione di una casa contro il suo prezzo. Le case più grandi costano di più, quindi i punti si muovono verso l'alto. La regressione lineare trova l'unica linea retta che si trova più vicina a tutti quei punti contemporaneamente. Inserisci la dimensione di una nuova casa e leggi il suo prezzo previsto. Questa è l'intera idea. È una macchina che impara la relazione tra un input e un output, poi la usa per fare previsioni.

Andrew Ng apre il suo famoso corso di machine learning alla Stanford University con questo esatto esempio del prezzo delle case, perché è l'algoritmo di apprendimento più semplice che esista e la base su cui tutto il resto è costruito.

La linea ha la formula che già conosci dalla scuola:

y = a + b x

Qui y è ciò che prevedi, x è il tuo input, b è la pendenza, quanto ripida è la salita di y all'aumentare di x, e a è l'intercetta, il valore di y quando x è zero. Il metodo che trova i migliori a e b è quello dei Minimi Quadrati Ordinari, o OLS. Tra tutte le linee possibili, OLS sceglie quella che rende minima la somma dei quadrati degli scarti tra la linea e i punti effettivi. Al quadrato, quindi sia gli errori sopra che sotto contano, e gli errori grandi vengono puniti molto più di quelli piccoli.

Puoi vedere tutto in poche righe:

python
1import numpy as np
2import statsmodels.api as sm
3
4x = np.array([1400, 1600, 1700, 1875, 2350, 2450]) # dimensione casa
5y = np.array([245, 312, 279, 308, 405, 324]) # prezzo in migliaia
6
7X = sm.add_constant(x) # aggiunge il termine di intercetta 'a'
8model = sm.OLS(y, X).fit()
9print(model.params) # ti restituisce a e b

Ora portiamolo nei mercati. Nel trading, la tua y diventa il rendimento di un asset, e la tua x diventa un fattore che secondo te prevede quel rendimento. La pendenza diventa la tua sensibilità a quel fattore. E quella umile intercetta, a, diventa il numero più importante nell'intera finanza quantitativa. Ecco perché.

Parte 2: Cos'è Realmente Alpha

Roan - inline image

Il rendimento totale si divide in beta, la parte spiegata dal mercato, e alpha, la parte che non può spiegare.

La maggior parte dei trader usa la parola alpha per significare profitto. Questo è sbagliato, e l'errore è costoso.

Alpha è il rendimento che la tua strategia genera e che non può essere spiegato dall'esposizione a fattori di rischio noti. Se hai guadagnato il 20% in un anno ma anche il mercato ha guadagnato il 20%, il tuo alpha è zero. Stavi solo detenendo beta, il rendimento che raccogli per assumerti il rischio di mercato. Sei stato pagato per cavalcare l'onda, non per abilità.

Questa distinzione è l'intero gioco, e la regressione è la lama che separa i due. Il modello fondamentale. Il rendimento della tua strategia al tempo t, scritto rₜ, è una linea di base più la sua esposizione a un fattore Xₜ più il rumore:

rₜ = α + β Xₜ + εₜ

Leggilo lentamente. Il β è la tua sensibilità al fattore. Se il fattore è il mercato, beta dice quanto ti muovi quando il mercato si muove. L'εₜ è il rumore casuale, la parte che nessun fattore spiega. E α, l'intercetta, è il rendimento che guadagni in media quando il fattore non contribuisce per niente.

Quell'intercetta è l'intero premio. Se dopo aver rimosso ogni fattore di rischio noto la tua strategia mostra ancora un alpha positivo e statisticamente significativo, hai trovato qualcosa di reale. Se l'alpha svanisce nel momento in cui tieni conto dei fattori, non hai mai avuto un vantaggio. Avevi beta mascherato sotto le spoglie del genio.

Michael Jensen ha per primo inquadrato l'abilità in questo modo nel 1968 quando ha testato se i gestori di fondi comuni potessero effettivamente battere il mercato. Ha eseguito questa esatta regressione e ha posto una domanda: l'intercetta è diversa da zero? Quasi sessant'anni dopo, questo è ancora il modo in cui viene giudicata la performance istituzionale. Si chiama alpha di Jensen, ed è il fondamento della disciplina.

**Quindi, quando costruisci un segnale, il tuo compito non è mai massimizzare il rendimento grezzo.

Il tuo compito è produrre un'intercetta positiva che sopravviva dopo che i fattori noti sono stati rimossi. Tienilo a mente. Tutto il resto serve a questo.**

Parte 3: Costruire il Tuo Primo Segnale da Zero

Roan - inline image

Un segnale reale misura alpha solo dopo che ogni fattore noto è stato eliminato.

Costruiamo il modello reale più semplice, poi rendiamolo di livello istituzionale. Supponi di credere che il rendimento di un asset possa essere in parte previsto da un fattore. Il rendimento precedente di un asset correlato, una misura di momentum, una metrica di valore. La regressione a fattore singolo è:

rₜ = α + β Xₜ + εₜ

In Python sono una manciata di righe, e l'intercetta è la parte che non devi mai saltare:

python
1import statsmodels.api as sm
2
3# X è la tua serie di fattori, y è il rendimento dell'asset che vuoi spiegare
4X = sm.add_constant(X) # QUESTA riga crea la tua intercetta alpha
5model = sm.OLS(y, X).fit()
6print(model.summary())

Quella riga add_constant non è una formalità. È la riga che crea il tuo termine alpha. Dimenticala e costringi la linea a passare per zero, buttando via il numero più importante dell'intero output.

Ma il mondo reale non è mai un fattore solo. Un segnale serio tiene conto di molte influenze contemporaneamente. Questo è il modello multifattoriale:

rₜ = α + β₁X₁ₜ + β₂X₂ₜ + ... + βₖXₖₜ + εₜ

Ogni beta ora misura l'effetto del proprio fattore, mantenendo costanti tutti gli altri. Quell'espressione, "mantenendo costanti gli altri", è il superpotere silenzioso della regressione. Isola il contributo unico di ogni fattore e rimuove le sovrapposizioni. Quando regredisci i rendimenti della tua strategia rispetto ai fattori stabiliti (mercato, dimensione, valore, momentum), qualunque alpha rimanga in quell'intercetta è la fetta del tuo vantaggio che nessuno dei fattori noti può spiegare.

python
1import statsmodels.api as sm
2
3# factors è un DataFrame, ogni colonna un fattore, allineato ai rendimenti y
4X = sm.add_constant(factors)
5model = sm.OLS(y, X).fit()
6
7alpha = model.params['const'] # il tuo potenziale vantaggio
8p_alpha = model.pvalues['const'] # quanto fidartene
9print("Alpha:", round(alpha, 5))
10print("P-value Alpha:", round(p_alpha, 4))

Quell'intercetta residua è il tuo segnale candidato. Tutto da qui in poi riguarda il dimostrare se è reale.

È esattamente qui che la maggior parte dei tutorial pubblici si ferma, e dove il lavoro istituzionale inizia davvero. La costruzione del fattore, la neutralizzazione, gli schemi di ponderazione che trasformano un segnale grezzo in un portafoglio negoziabile. Se vuoi vedere esattamente come un'azienda come AQR trasforma queste regressioni in un portafoglio fattoriale live, quel dettaglio è dove lo porto fino in fondo.

Parte 4: Leggere l'Output Come un Ricercatore Istituzionale

Roan - inline image

Il professionista non si chiede quanto sia grande il rendimento. Si chiede quanto è sicuro che non sia un incidente.

Quando esegui quel riepilogo, la maggior parte delle persone guarda un numero e va avanti. Un ricercatore addestrato lo legge come un referto diagnostico. Ecco cosa conta davvero.

Il coefficiente e il suo segno. Ogni beta dà direzione e forza. Prima di fidarti di qualsiasi numero, chiediti se il segno ha anche solo senso economico. Se il tuo modello dice di comprare quando qualcosa è più costoso e non sai spiegare perché, hai trovato un colpo di fortuna, non un fattore.

Il p-value. Questo è il cuore di tutto. Risponde a una domanda. Se questo fattore non avesse realmente alcun effetto, qual è la probabilità che vedrei una relazione così forte per puro caso? Un p-value di 0,62 significa una probabilità del 62% che tu stia fissando pura fortuna. Sotto 0,05 è la soglia convenzionale per prendere sul serio un risultato. Un quant che guarda un modello fallito con un p-value di 0,62 non sta guardando un segnale debole. Sta guardando puro rumore.

R-quadro. La frazione della variazione del rendimento che il tuo modello spiega, ed ecco la parte che lascia perplessi i principianti. Nella previsione dei rendimenti, un R-quadro alto è di solito un avvertimento, non un trofeo. I segnali di rendimento reali sono deboli. Un R-quadro di 0,01 o 0,02 può essere follemente redditizio se è persistente e reale. Se vedi 0,9 su una previsione di rendimento, hai quasi certamente un bias di look-ahead o stai regredendo qualcosa su se stesso per errore.

La statistica t. Il coefficiente diviso per il suo errore standard. Una regola approssimativa è che una statistica t superiore a 2 in valore assoluto corrisponde alla soglia di 0,05. I ricercatori seri richiedono 3 o più su un segnale completamente nuovo, proprio perché sanno quanti segnali hanno testato silenziosamente prima di questo.

Puoi estrarli direttamente invece di leggere l'intera tabella:

python
1print("Statistiche t:\n", model.tvalues)
2print("P-value:\n", model.pvalues)
3print("R-quadro:", round(model.rsquared, 4))

Interiorizza il cambiamento. Il principiante chiede quanto è grande il rendimento. Il professionista chiede quanto sono sicuro che questo rendimento non sia un incidente. Quel singolo cambiamento nella domanda è l'intera differenza.

Parte 5: I Test Che Separano il Segnale Reale dal Rumore, e Perché i Segnali Muoiono

Roan - inline image

Fai passare ogni candidato attraverso lo stesso percorso di selezione. Quasi nulla sopravvive, ed è questo il punto.

Ecco la verità brutale. Se testi abbastanza segnali casuali, alcuni sembreranno redditizi per puro caso. Testa 100 segnali inutili al livello di significatività 0,05 e circa 5 passeranno per fortuna. Questo è il problema dei test multipli ed è la ragione numero uno per cui i backtest mentono. Ecco come i desk seri si difendono.

Validazione out-of-sample. Non giudicare mai un segnale sui dati su cui lo hai costruito. Dividi la tua cronologia. Costruisci sulla prima parte, testa su una parte che il modello non ha mai visto. Un segnale reale sopravvive all'attraversamento. Una fantasia adattata crolla non appena incontra dati freschi. Non negoziabile.

python
1split = int(len(y) * 0.8)
2X_train, X_test = X[:split], X[split:]
3y_train, y_test = y[:split], y[split:]
4
5model = sm.OLS(y_train, X_train).fit()
6oos_pred = model.predict(X_test) # test su dati mai visti

Coefficiente di Informazione (IC). I ricercatori di fattori istituzionali raramente vivono o muoiono per una singola regressione. Calcolano l'IC, la correlazione tra il valore di un fattore e il rendimento futuro effettivo, più e più volte nel tempo. Un fattore con un IC medio superiore a circa 0,03-0,05 che rimane stabile attraverso molti periodi batte sempre uno con un singolo backtest stupendo. La stabilità tra diversi regimi di mercato è il vero indicatore.

Errori standard di Newey-West. I dati finanziari infrangono un'ipotesi fondamentale degli OLS perché i rendimenti e la volatilità si raggruppano nel tempo. I p-value grezzi mentiranno, di solito lusingando il tuo segnale. Newey-West corregge i tuoi errori standard per questo. Usarlo segnala silenziosamente qualcuno che sa cosa sta facendo.

python
1# Significatività corretta con Newey-West, lo standard istituzionale
2model = sm.OLS(y, X).fit(cov_type='HAC', cov_kwds={'maxlags': 5})
3print(model.summary())

Correzione per test multipli. Se hai provato 50 segnali, non puoi giudicare il vincitore con il parametro normale. La difesa semplice è Bonferroni: dividere la tua soglia per il numero di cose che hai testato. Hai provato 50 segnali? Richiedi un p-value inferiore a 0,001, non 0,05. È brutale, ed è questo il punto. Forza all'onestà su quante volte hai buttato l'amo.

Fai passare un candidato attraverso la validazione out-of-sample, un IC stabile, la significatività Newey-West e una correzione per test multipli, e se è ancora in piedi, hai qualcosa che la maggior parte dei trader al dettaglio non produce in tutta la vita. Un segnale di cui ti sei guadagnato il diritto di fidarti.

Ma comprendi la verità finale. Anche un segnale reale decade. Alpha vive nell'inefficienza del mercato, e nel momento in cui un segnale è conosciuto e viene scambiato, lo scambio stesso allontana l'inefficienza. Ricerche recenti sull'affollamento fattoriale mostrano che i segnali meccanici e facilmente copiabili, come il semplice momentum, decadono lungo una curva ripida e prevedibile man mano che il capitale si accumula, e che questo affollamento è accelerato bruscamente da quando l'investimento fattoriale è diventato economico tramite gli ETF. I segnali più semplici sono i più affollati e muoiono più velocemente. Il vantaggio durevole vive in segnali che richiedono un vero lavoro per essere costruiti, e in un processo di ricerca che ne produce di nuovi più velocemente di quanto quelli vecchi si erodano. Ecco perché Renaissance non ha mai smesso di fare ricerca per un solo giorno in trent'anni.

Compiti a casa: Prendi un segnale in cui credi attualmente. Eseguilo sul 20% più recente dei tuoi dati, che fingerai di non aver mai visto. Se l'alpha scompare, ti sei appena risparmiato soldi veri. È il test più prezioso che farai mai.

Parte 6: Cosa Hai Appena Costruito, Dall'Inizio alla Fine

Roan - inline image

Ogni segnale reale si erode man mano che diventa affollato. Il motore di ricerca che li sostituisce è il vero vantaggio.

Fai un passo indietro e guarda la macchina completa che ora hai, perché i pezzi si collegano in un'unica pipeline pulita.

Inizi con un fattore, qualsiasi cosa tu creda porti informazioni sui rendimenti futuri. Regredisci i rendimenti del tuo asset su quel fattore con gli OLS, includendo sempre l'intercetta, e quell'intercetta è il tuo alpha candidato. Espandi a una regressione multifattoriale in modo che il tuo alpha sia misurato solo dopo che i fattori di rischio noti (mercato, dimensione, valore, momentum) sono stati rimossi. Ciò che rimane nell'intercetta è puro vantaggio inspiegato.

Poi lo interroghi. Leggi il p-value per chiederti se potrebbe essere fortuna. Controlli il segno per verificarne il senso economico. Ignori l'allettante R-quadro alto e rispetti quello piccolo e onesto. Esegui una validazione out-of-sample su dati che il modello non ha mai toccato. Calcoli il Coefficiente di Informazione su molti periodi per confermare che è stabile, non un colpo di fortuna una tantum. Correggi i tuoi errori standard con Newey-West in modo che la struttura temporale dei mercati non ti inganni. E applichi una correzione per test multipli in modo che il numero di segnali che hai provato non possa fabbricare un falso vincitore.

Ciò che esce dall'altra parte non è un'ipotesi. È un segnale con un vantaggio misurato, un livello di confidenza noto, la prova che sopravvive su dati mai visti e una contabilità onesta di quanto è probabile che sia reale. Questa è la differenza tra la persona il cui modello muore in due settimane e la persona che costruisce qualcosa che regge.

Ed ecco come fa effettivamente guadagnare soldi. Un segnale con un vantaggio piccolo ma genuino e stabile, scambiato su molte opportunità indipendenti, si compone. Renaissance aveva ragione poco più della metà delle volte e ha trasformato questo nella più grande fortuna nella storia del mercato, perché il vantaggio era reale, era ripetibile, e lo hanno dimensionato correttamente su un numero enorme di scommesse. Ora stai lavorando dallo stesso progetto. Costruisci il segnale, dimostra che è reale, dimensionalo in modo sensato e sostituiscilo nel momento in cui il suo IC inizia a sbiadire.

Quel ciclo di sostituzione è l'intera carriera. Un segnale è un'operazione. Un processo di ricerca che continua a produrre segnali reali più velocemente di quanto decadano è una macchina da reddito.

Il Riepilogo

La regressione lineare non è lo strumento noioso che hai saltato. Disegna la linea migliore attraverso i tuoi dati, definisce cosa sia realmente alpha, costruisce il tuo primo segnale reale, testa se quel segnale è genuino o rumore e ti avverte quando il segnale inizia a morire.

Alpha è l'intercetta che sopravvive dopo che ogni fattore di rischio noto è stato rimosso. Costruisci un candidato con gli OLS, prima a fattore singolo, poi multifattoriale. Leggi l'output come un ricercatore, dove il p-value e la stabilità contano più della dimensione del rendimento. Ti difendi dalla trappola dei test multipli con la validazione out-of-sample, un Coefficiente di Informazione stabile, errori di Newey-West e una correzione per il numero di segnali che hai provato. E accetti che ogni segnale reale decade, il che significa che il vero vantaggio è il motore di ricerca, non un singolo modello. Lo stesso motore che ha costruito il più grande fondo della storia.

Il quant che fissa uno Sharpe di 0,03 e un p-value di 0,62 non è sfortunato. Ha saltato la disciplina contenuta in questo articolo. Non essere lui.

Ecco la domanda su cui voglio che rifletti.

Se l'alpha reale decade nel momento in cui diventa ampiamente noto, allora pubblicare un segnale lo distrugge, mentre tenere nascosto un segnale significa che muore comunque lentamente mentre altri lo scoprono indipendentemente.

Allora, da dove viene realmente il vantaggio durevole? Dai segnali stessi, o dalla velocità del processo di ricerca che li sostituisce?

La tua risposta rivela se pensi come un trader che insegue una grande vincita, o come un quant che costruisce una macchina che stampa vantaggio per decenni.

Scrivi la tua risposta nei commenti. Non esiste una risposta sbagliata. Ma ce ne sono di molto rivelatrici.

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali