Como usar regressão linear para criar sinais de alfa (Framework Quant)

@RohOnChain
INGLÊShá 2 meses · 08 de jun. de 2026
475K
339
30
23
824

TL;DR

Este guia detalha a abordagem institucional da regressão linear no trading, explicando como isolar alfa de beta, validar sinais usando p-valores e se proteger contra ruídos com testes fora da amostra.

Eu vou explicar como usar regressão linear para vencer todas as negociações, construir um sinal alfa real e compartilhar o código exato que funciona.

Vamos direto ao ponto.

Marque Isto

- Sou Roan, desenvolvedor back-end trabalhando com design de sistemas, execução estilo HFT e sistemas de trading quantitativo. Meu foco é entender como os mercados de previsão se comportam sob carga. Para sugestões, colaborações inteligentes ou parcerias, DMs estão abertas.

Todo quant tem uma versão dessa história.

Você passa uma semana em um modelo. O backtest parece perfeito, a curva de equity aponta para cima e você acha que finalmente encontrou. Vai ao vivo. Duas semanas depois está perdendo dinheiro e não faz ideia do porquê.

Eu vi esse ciclo encerrar mais carreiras de quants do que qualquer crash de mercado. O modelo nunca foi real. Era ruído disfarçado de sinal. E a habilidade mais valiosa em todo esse campo é aprender a diferenciar os dois antes de arriscar um único dólar.

Essa habilidade começa com a ferramenta mais subestimada das finanças quantitativas.

Regressão linear.

Eu sei como isso soa. Regressão linear é aquela coisa que todo mundo acha que aprendeu em uma tarde e deixou para trás. Mas aqui está o que me custou anos e perdas reais para entender. As pessoas que gerenciam bilhões nas principais empresas não estão usando monstros exóticos de deep learning para a maioria de seus sinais principais. Elas usam regressão linear, entendida muito mais profundamente do que a maioria das pessoas jamais vai, aplicada com uma disciplina que a maioria nunca constrói.

Olhe para a operação de trading mais bem-sucedida da história.

Jim Simons construiu a Renaissance Technologies exatamente sobre essa base. Seu Medallion Fund teve uma média de retornos anuais brutos de aproximadamente 66% entre 1988 e 2018, o melhor desempenho já registrado. E, segundo sua própria equipe, o fundo acertou apenas cerca de 50,75% de suas negociações. Em milhões de trades, essa vantagem mínima se transformou em mais de 100 bilhões de dólares. Eles não estavam prevendo o futuro. Estavam extraindo um sinal pequeno, real e repetível de um oceano de ruído, que é exatamente para o que a regressão foi feita.

A AQR, que agora administra cerca de 179 bilhões de dólares, construiu seu império com modelos de fatores baseados em regressão.

A PDT Partners operou com arbitragem estatística por anos sem um único ano perdendo.

Esta é a versão da regressão linear que ninguém te ensinou.

Ao final deste artigo, você entenderá o que a regressão linear realmente é, o que alfa realmente significa, como construir um sinal de fator único e multifator do zero com código real, como ler uma saída de regressão como um pesquisador institucional, os testes exatos que separam um sinal real de uma coincidência e por que até mesmo um sinal real eventualmente morre.

Nota: Este artigo é deliberadamente longo e cada parte se baseia na anterior. Se você leva a sério a construção de sinais que sobrevivem em mercados reais, leia cada palavra. Se você quer um indicador mágico, isso não é para você.

Parte 1: O Que a Regressão Linear Realmente É

Roan - inline image

A regressão linear encontra a única linha reta que fica mais próxima de todos os pontos de dados ao mesmo tempo.

Esqueça finanças por um segundo.

Regressão linear é apenas a matemática de desenhar a melhor linha reta através de uma nuvem de pontos.

Imagine plotar o tamanho da casa contra o preço da casa. Casas maiores custam mais, então os pontos sobem. A regressão linear encontra a única linha reta que fica mais próxima de todos esses pontos ao mesmo tempo. Alimente o tamanho de uma nova casa e você lê o preço previsto. Essa é a ideia toda. É uma máquina que aprende a relação entre uma entrada e uma saída e depois a usa para prever.

Andrew Ng abre seu famoso curso de machine learning de Stanford com exatamente este exemplo de preço de casa, porque é o algoritmo de aprendizado mais simples que existe e a base sobre a qual tudo o mais é construído.

A linha tem a fórmula que você já conhece da escola:

y = a + b x

Aqui, y é o que você prevê, x é sua entrada, b é a inclinação, o quanto y aumenta conforme x aumenta, e a é o intercepto, o valor de y quando x é zero. O método que encontra os melhores a e b é o Método dos Mínimos Quadrados Ordinários, ou OLS. De todas as linhas possíveis, o OLS escolhe aquela que torna a soma dos quadrados dos gaps entre a linha e os pontos reais a menor possível. Ao quadrado, para que erros acima e abaixo contem, e erros grandes sejam punidos muito mais que os pequenos.

Você pode ver tudo em algumas linhas:

python
1import numpy as np
2import statsmodels.api as sm
3
4x = np.array([1400, 1600, 1700, 1875, 2350, 2450]) # tamanho da casa
5y = np.array([245, 312, 279, 308, 405, 324]) # preço em milhares
6
7X = sm.add_constant(x) # adiciona o termo de intercepto 'a'
8model = sm.OLS(y, X).fit()
9print(model.params) # fornece a e b

Agora traga isso para os mercados. No trading, seu y se torna o retorno de um ativo, e seu x se torna um fator que você acredita que prevê esse retorno. A inclinação se torna sua sensibilidade a esse fator. E aquele humilde intercepto, a, se torna o número mais importante em finanças quantitativas. Aqui está o porquê.

Parte 2: O Que Alfa Realmente É

Roan - inline image

O retorno total se divide em beta, a parte que o mercado explica, e alfa, a parte que ele não consegue explicar.

A maioria dos traders usa a palavra alfa para significar lucro. Isso está errado, e o erro é caro.

Alfa é o retorno que sua estratégia gera que não pode ser explicado pela exposição a fatores de risco conhecidos. Se você ganhou 20% em um ano, mas o mercado também ganhou 20%, seu alfa é zero. Você estava apenas segurando beta, o retorno que você recebe por assumir risco de mercado. Você foi pago por surfar a onda, não por habilidade.

Essa distinção é o jogo inteiro, e a regressão é a lâmina que separa os dois. O modelo fundamental. O retorno da sua estratégia no tempo t, escrito rₜ, é uma linha de base mais sua exposição a um fator Xₜ mais ruído:

rₜ = α + β Xₜ + εₜ

Leia devagar. O β é sua sensibilidade ao fator. Se o fator é o mercado, beta diz o quanto você se move quando o mercado se move. O εₜ é ruído aleatório, a parte que nenhum fator explica. E α, o intercepto, é o retorno que você ganha em média quando o fator não contribui em nada.

Esse intercepto é o prêmio inteiro. Se depois de eliminar todos os fatores de risco conhecidos sua estratégia ainda mostra um alfa positivo e estatisticamente significativo, você encontrou algo real. Se o alfa desaparece no momento em que você considera os fatores, você nunca teve vantagem. Você tinha beta disfarçado de gênio.

Michael Jensen enquadrou a habilidade dessa forma pela primeira vez em 1968, quando testou se os gestores de fundos mútuos conseguiam realmente superar o mercado. Ele executou essa regressão exata e fez uma pergunta: o intercepto é diferente de zero? Quase sessenta anos depois, essa ainda é a forma como o desempenho institucional é avaliado. Chama-se alfa de Jensen, e é a base da disciplina.

**Portanto, quando você constrói um sinal, seu trabalho nunca é maximizar o retorno bruto.

É produzir um intercepto positivo que sobreviva depois que os fatores conhecidos forem removidos. Segure isso. Todo o resto serve a isso.**

Parte 3: Construindo Seu Primeiro Sinal do Zero

Roan - inline image

Um sinal real mede alfa somente depois que cada fator conhecido foi removido.

Vamos construir o modelo real mais simples e depois torná-lo de nível institucional. Suponha que você acredita que o retorno de um ativo pode ser parcialmente previsto por um fator: o retorno anterior de um ativo relacionado, uma medida de momentum, uma métrica de valor. A regressão de fator único é:

rₜ = α + β Xₜ + εₜ

Em Python, são algumas linhas, e o intercepto é a parte que você nunca deve pular:

python
1import statsmodels.api as sm
2
3# X é sua série de fatores, y é o retorno do ativo que você quer explicar
4X = sm.add_constant(X) # ESTA linha cria seu intercepto alfa
5model = sm.OLS(y, X).fit()
6print(model.summary())

Essa linha add_constant não é uma formalidade. É a linha que cria seu termo alfa. Esqueça-a e você força a linha a passar por zero, jogando fora o número mais importante de toda a saída.

Mas o mundo real nunca é de um fator só. Um sinal sério leva em conta muitas influências ao mesmo tempo. Esse é o modelo multifator:

rₜ = α + β₁X₁ₜ + β₂X₂ₜ + ... + βₖXₖₜ + εₜ

Cada beta agora mede o efeito de seu próprio fator enquanto mantém todos os outros constantes. Essa frase, "mantendo os outros constantes", é o superpoder silencioso da regressão. Ela isola a contribuição única de cada fator e elimina a sobreposição. Quando você regride os retornos de sua estratégia contra os fatores estabelecidos — mercado, tamanho, valor, momentum — qualquer alfa que sobrar naquele intercepto é a fatia de sua vantagem que nenhum dos fatores conhecidos consegue explicar.

python
1import statsmodels.api as sm
2
3# factors é um DataFrame, cada coluna um fator, alinhado aos retornos y
4X = sm.add_constant(factors)
5model = sm.OLS(y, X).fit()
6
7alpha = model.params['const'] # sua vantagem candidata
8p_alpha = model.pvalues['const'] # o quanto confiar nela
9print("Alfa:", round(alpha, 5))
10print("Valor-p do alfa:", round(p_alpha, 4))

Esse intercepto residual é seu sinal candidato. Tudo daqui em diante é sobre provar se ele é real.

É exatamente aqui que a maioria dos tutoriais públicos para, e onde o trabalho institucional realmente começa. A construção dos fatores, a neutralização, os esquemas de ponderação que transformam um sinal bruto em um portfólio negociável. Se você quiser ver exatamente como uma empresa como a AQR transforma essas regressões em um portfólio de fatores ao vivo, essa análise é onde eu levo tudo até o fim.

Parte 4: Lendo a Saída Como um Pesquisador Institucional

Roan - inline image

O profissional não pergunta quão grande é o retorno. Ele pergunta o quão confiante está de que não é um acidente.

Quando você executa aquele resumo, a maioria das pessoas olha para um número e segue em frente. Um pesquisador treinado lê como um relatório de diagnóstico. Aqui está o que realmente importa.

O coeficiente e seu sinal. Cada beta dá direção e força. Antes de confiar em qualquer número, pergunte se o sinal faz sentido econômico. Se seu modelo diz para comprar quando algo está mais caro e você não consegue explicar por que, você encontrou um acaso, não um fator.

O valor-p. Este é o coração de tudo. Ele responde a uma pergunta: se este fator realmente não tivesse efeito, qual a probabilidade de eu ver uma relação tão forte apenas por acaso? Um valor-p de 0,62 significa uma chance de 62% de você estar olhando para sorte aleatória. Abaixo de 0,05 é a barreira convencional para levar um resultado a sério. Um quant olhando para um modelo fracassado com valor-p de 0,62 não está vendo um sinal fraco. Ele está olhando para ruído puro.

R-quadrado. A fração da variação do retorno que seu modelo explica, e aqui está a parte que vira iniciantes de cabeça para baixo. Na previsão de retornos, um R-quadrado alto é geralmente um aviso, não um troféu. Sinais de retorno reais são fracos. Um R-quadrado de 0,01 ou 0,02 pode ser extremamente lucrativo se for persistente e real. Se você vir 0,9 em uma previsão de retorno, quase certamente tem viés de look-ahead ou está regredindo algo contra si mesmo por acidente.

A estatística t. O coeficiente dividido por seu erro padrão. Uma regra aproximada é que uma estatística t acima de 2 em valor absoluto corresponde ao limite de 0,05. Pesquisadores sérios exigem 3 ou mais em um sinal novo, precisamente porque sabem quantos sinais testaram silenciosamente antes deste.

Você pode extrair esses valores diretamente em vez de ler a tabela inteira:

python
1print("Estatísticas t:\n", model.tvalues)
2print("Valores-p:\n", model.pvalues)
3print("R-quadrado:", round(model.rsquared, 4))

Internalize a mudança. O iniciante pergunta quão grande é o retorno. O profissional pergunta o quão confiante estou de que esse retorno não é um acidente. Essa única mudança na pergunta é toda a diferença.

Parte 5: Os Testes Que Separaram Sinal Real de Ruído, e Por Que os Sinais Morrem

Roan - inline image

Execute cada candidato pelo mesmo crivo. Quase nada sobrevive, e esse é o objetivo.

Aqui está a verdade cruel. Se você testar sinais aleatórios suficientes, alguns parecerão lucrativos por pura sorte. Teste 100 sinais inúteis no nível de 0,05 e cerca de 5 passarão apenas por sorte. Este é o problema de testes múltiplos e é a razão número um pela qual os backtests mentem. Veja como as mesas sérias se defendem contra isso.

Teste fora da amostra. Nunca julgue um sinal com os dados em que o construiu. Divida seu histórico. Construa na primeira parte, teste em uma parte que o modelo nunca viu. Um sinal real sobrevive à travessia. Uma fantasia ajustada desmorona no instante em que encontra dados novos. Inegociável.

python
1split = int(len(y) * 0.8)
2X_train, X_test = X[:split], X[split:]
3y_train, y_test = y[:split], y[split:]
4
5model = sm.OLS(y_train, X_train).fit()
6oos_pred = model.predict(X_test) # testa em dados não vistos

Coeficiente de Informação. Pesquisadores institucionais de fatores raramente vivem ou morrem por uma única regressão. Eles calculam o IC, a correlação entre o valor de um fator e o retorno futuro real, repetidamente ao longo do tempo. Um fator com um IC médio acima de cerca de 0,03 a 0,05 que se mantém estável em muitos períodos vence um único backtest bonito toda vez. Estabilidade entre regimes é o verdadeiro indicador.

Erros padrão de Newey-West. Dados financeiros quebram uma suposição central do OLS porque retornos e volatilidade se aglomeram no tempo. Valores-p brutos mentirão, geralmente favorecendo seu sinal. Newey-West corrige seus erros padrão para isso. Usá-lo marca silenciosamente alguém que sabe o que está fazendo.

python
1# Significância corrigida por Newey-West, o padrão institucional
2model = sm.OLS(y, X).fit(cov_type='HAC', cov_kwds={'maxlags': 5})
3print(model.summary())

Correção para testes múltiplos. Se você tentou 50 sinais, não pode julgar o vencedor pela barreira normal. A defesa simples é Bonferroni: dividir seu limiar pelo número de coisas que testou. Tentou 50 sinais? Exija um valor-p abaixo de 0,001, não de 0,05. É brutal, e esse é o objetivo. Força a honestidade sobre quantas vezes você foi pescar.

Execute um candidato através da validação fora da amostra, de um IC estável, da significância de Newey-West e de uma correção para testes múltiplos. E se ele ainda estiver de pé, você tem algo que a maioria dos traders de varejo nunca produz em suas vidas: um sinal em que você genuinamente ganhou o direito de confiar.

Mas entenda a verdade final. Até mesmo um sinal real decai. Alfa vive na ineficiência do mercado, e no momento em que um sinal é conhecido e negociado, a própria negociação empurra a ineficiência para longe. Pesquisas recentes sobre aglomeração de fatores mostram que sinais mecânicos e facilmente copiados, como momentum simples, decaem ao longo de uma curva previsível e acentuada à medida que o capital entra, e que essa aglomeração se acelerou drasticamente quando o investimento em fatores se tornou barato por meio de ETFs. Os sinais mais simples são os mais congestionados e morrem mais rápido. Vantagem durável vive em sinais que exigem trabalho real para construir e em um processo de pesquisa que produz novos mais rápido do que os antigos se desgastam. É por isso que a Renaissance nunca parou de pesquisar um único dia em trinta anos.

Trabalho de casa: Pegue um sinal em que você atualmente acredita. Execute-o nos 20% mais recentes de seus dados, que você fingirá que nunca viu. Se o alfa desaparecer, você acabou de economizar dinheiro real. É o teste mais valioso que você fará.

Parte 6: O Que Você Acabou de Construir, do Início ao Fim

Roan - inline image

Todo sinal real se desgasta à medida que fica congestionado. O motor de pesquisa que os substitui é a verdadeira vantagem.

Recue e olhe para a máquina completa que você agora tem, porque as peças se conectam em um pipeline limpo.

Você começa com um fator — qualquer coisa que você acredite conter informação sobre retornos futuros. Você regride os retornos de seu ativo nesse fator com OLS, sempre incluindo o intercepto, e esse intercepto é seu alfa candidato. Você expande para uma regressão multifator para que seu alfa seja medido somente após os fatores de risco conhecidos — mercado, tamanho, valor, momentum — terem sido removidos. O que resta no intercepto é vantagem pura e inexplicada.

Então você o interroga. Você lê o valor-p para perguntar se poderia ser sorte. Você verifica o sinal quanto ao sentido econômico. Você ignora o sedutor R-quadrado alto e respeita o pequeno e honesto. Você valida fora da amostra em dados que o modelo nunca tocou. Você calcula o Coeficiente de Informação em muitos períodos para confirmar que é estável, não um acaso único. Você corrige seus erros padrão com Newey-West para que a estrutura temporal dos mercados não o engane. E você aplica uma correção para testes múltiplos para que o número de sinais que tentou não possa fabricar um vencedor falso.

O que sai do outro lado não é um palpite. É um sinal com uma vantagem medida, um nível de confiança conhecido, prova de que sobrevive em dados não vistos e uma contabilidade honesta de quão provável é que seja real. Essa é a diferença entre a pessoa cujo modelo morre em duas semanas e a pessoa que constrói algo que se sustenta.

E aqui está como realmente ganha dinheiro. Um sinal com uma vantagem pequena, mas genuína e estável, negociado em muitas oportunidades independentes, se acumula. A Renaissance acertou pouco mais da metade das vezes e transformou isso na maior fortuna da história do mercado, porque a vantagem era real, era repetível e eles a dimensionaram corretamente em um número enorme de apostas. Você agora está trabalhando a partir do mesmo projeto. Construa o sinal, prove que é real, dimensione-o sensatamente e substitua-o no momento em que seu IC começar a desaparecer.

Esse loop de substituição é a carreira inteira. Um sinal é um trade. Um processo de pesquisa que continua produzindo sinais reais mais rápido do que eles se desgastam é uma franquia.

O Resumo

A regressão linear não é a ferramenta chata que você ignorou. Ela desenha a melhor linha através de seus dados, define o que alfa realmente é, constrói seu primeiro sinal real, testa se esse sinal é genuíno ou ruído e avisa quando o sinal começa a morrer.

Alfa é o intercepto que sobrevive depois que todo fator de risco conhecido é removido. Você constrói um candidato com OLS, primeiro fator único, depois multifator. Você lê a saída como um pesquisador, onde o valor-p e a estabilidade importam mais do que o tamanho do retorno. Você se defende contra a armadilha de testes múltiplos com validação fora da amostra, um Coeficiente de Informação estável, erros de Newey-West e uma correção para quantos sinais tentou. E você aceita que todo sinal real decai, o que significa que a verdadeira vantagem é o motor de pesquisa, não qualquer modelo único. O mesmo motor que construiu o maior fundo da história.

O quant olhando para um Sharpe de 0,03 e um valor-p de 0,62 não está sem sorte. Ele pulou a disciplina deste artigo. Não seja ele.

Aqui está a pergunta que quero que você considere.

Se o alfa real decai no momento em que se torna amplamente conhecido, então publicar um sinal o destrói, enquanto esconder um sinal significa que ele ainda morre lentamente enquanto outros o descobrem independentemente.

Então, de onde vem a vantagem durável? Dos próprios sinais, ou da velocidade do processo de pesquisa que os substitui?

Sua resposta revela se você pensa como um trader em busca de uma grande vitória, ou como um quant construindo uma máquina que imprime vantagem por décadas.

Coloque sua resposta nos comentários. Não há resposta errada. Mas há respostas muito reveladoras.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais