Como usar regressão linear para criar sinais de alfa (Framework Quantitativo)

@RohOnChain
INGLÊShá 2 meses · 08/06/2026
475K
339
30
23
824

TL;DR

Este guia detalha a abordagem institucional da regressão linear no trading, explicando como isolar alfa de beta, validar sinais usando p-values e se proteger contra ruídos com testes fora da amostra (out-of-sample).

Vou detalhar como usar regressão linear para vencer todas as negociações, construir um sinal alfa real e compartilhar o código vencedor.

Vamos direto ao assunto.

Marque isto

- Sou Roan, desenvolvedor backend trabalhando com design de sistemas, execução estilo HFT e sistemas de trading quantitativo. Meu foco é como os mercados de previsão realmente se comportam sob carga. Para sugestões, colaborações ponderadas ou parcerias, DMs estão abertas.

Todo quant tem uma versão desta história.

Você passa uma semana em um modelo. O backtest parece perfeito, a curva de patrimônio aponta para cima e você acha que finalmente encontrou. Você vai para o live. Duas semanas depois, está perdendo dinheiro e não faz ideia do porquê.

Já vi este ciclo encerrar mais carreiras de quant do que qualquer crash de mercado. O modelo nunca foi real. Era ruído disfarçado de sinal. E a habilidade mais valiosa em todo este campo é aprender a distinguir esses dois antes de arriscar um único dólar.

Essa habilidade começa com a ferramenta mais subestimada em finanças quantitativas.

Regressão linear.

Eu sei como isso soa. Regressão linear é aquela coisa que todo mundo acha que aprendeu em uma tarde e deixou para trás. Mas aqui está o que me levou anos e perdas reais para entender. As pessoas que administram bilhões nas principais firmas não estão usando monstros exóticos de deep learning para a maioria de seus sinais principais. Eles usam regressão linear, compreendida muito mais profundamente do que a maioria das pessoas jamais vai, aplicada com uma disciplina que a maioria nunca desenvolve.

Olhe para a operação de trading mais bem-sucedida da história.

Jim Simons construiu a Renaissance Technologies exatamente sobre essa base. Seu Medallion Fund teve uma média de retornos anuais brutos de aproximadamente 66% de 1988 a 2018, o melhor recorde já registrado. E, segundo sua própria equipe, o fundo acertou apenas cerca de 50,75% de suas negociações. Em milhões de negociações, essa margem extremamente fina se transformou em mais de 100 bilhões de dólares. Eles não estavam prevendo o futuro. Eles estavam extraindo um sinal minúsculo, real e repetível de um oceano de ruído, que é exatamente para isso que a regressão serve.

A AQR, que agora administra cerca de 179 bilhões de dólares, construiu seu império com modelos de fatores baseados em regressão.

A PDT Partners administrou arbitragem estatística por anos sem um único ano de perda.

Esta é a versão da regressão linear que ninguém te ensinou.

Ao final deste artigo, você entenderá o que a regressão linear realmente é, o que alfa realmente significa, como construir um sinal de fator único e multifatorial do zero com código real, como ler uma saída de regressão como um pesquisador institucional, os testes exatos que separam um sinal real de uma coincidência e por que até mesmo um sinal real eventualmente morre.

Nota: Este artigo é deliberadamente longo e cada parte se baseia na anterior. Se você leva a sério a construção de sinais que sobrevivem em mercados reais, leia cada palavra. Se você quer um indicador mágico, isso não é para você.

Parte 1: O Que a Regressão Linear Realmente É

Roan - inline image

A regressão linear encontra a única linha reta que fica mais próxima de todos os pontos de dados ao mesmo tempo.

Esqueça finanças por um segundo.

Regressão linear é apenas a matemática de desenhar a melhor linha reta através de uma nuvem de pontos.

Imagine plotar o tamanho de uma casa contra o preço da casa. Casas maiores custam mais, então os pontos sobem. A regressão linear encontra a única linha reta que fica mais próxima de todos esses pontos ao mesmo tempo. Insira o tamanho de uma nova casa e você obtém seu preço previsto. Essa é toda a ideia. É uma máquina que aprende a relação entre uma entrada e uma saída e, em seguida, a usa para prever.

Andrew Ng abre seu famoso curso de machine learning de Stanford com exatamente este exemplo de preço de casa, porque é o algoritmo de aprendizado mais simples que existe e a base sobre a qual tudo o resto é construído.

A linha tem a fórmula que você já conhece da escola:

y = a + b x

Aqui y é o que você prevê, x é sua entrada, b é a inclinação, o quanto y aumenta à medida que x aumenta, e a é o intercepto, o valor de y quando x é zero. O método que encontra os melhores a e b é o Método dos Mínimos Quadrados Ordinários, ou OLS. De todas as linhas possíveis, o OLS escolhe aquela que torna a soma dos quadrados das diferenças entre a linha e os pontos reais a menor possível. Quadrados, para que erros acima e abaixo contem, e erros grandes sejam punidos muito mais do que erros pequenos.

Você pode ver tudo em algumas linhas:

python
1import numpy as np
2import statsmodels.api as sm
3
4x = np.array([1400, 1600, 1700, 1875, 2350, 2450]) # tamanho da casa
5y = np.array([245, 312, 279, 308, 405, 324]) # preço em milhares
6
7X = sm.add_constant(x) # adiciona o termo de intercepto 'a'
8modelo = sm.OLS(y, X).fit()
9print(modelo.params) # fornece a e b

Agora traga para os mercados. Em trading, seu y se torna o retorno de um ativo, e seu x se torna um fator que você acredita prever esse retorno. A inclinação se torna sua sensibilidade a esse fator. E aquele humilde intercepto, a, se torna o número mais importante em finanças quantitativas. Eis o porquê.

Parte 2: O Que Alfa Realmente É

Roan - inline image

O retorno total se divide em beta, a parte que o mercado explica, e alfa, a parte que ele não consegue explicar.

A maioria dos traders usa a palavra alfa para significar lucro. Isso está errado, e o erro é caro.

Alfa é o retorno que sua estratégia gera que não pode ser explicado pela exposição a fatores de risco conhecidos. Se você ganhou 20% em um ano, mas o mercado também ganhou 20%, seu alfa é zero. Você estava apenas segurando beta, o retorno que você coleta por assumir risco de mercado. Você foi pago por surfar a onda, não pela habilidade.

Essa distinção é todo o jogo, e a regressão é a lâmina que separa os dois. O modelo fundamental. O retorno da sua estratégia no tempo t, escrito rₜ, é uma linha de base mais sua exposição a um fator Xₜ mais ruído:

rₜ = α + β Xₜ + εₜ

Leia devagar. O β é sua sensibilidade ao fator. Se o fator é o mercado, beta diz o quanto você se move quando o mercado se move. O εₜ é ruído aleatório, a parte que nenhum fator explica. E α, o intercepto, é o retorno que você ganha em média quando o fator não contribui em nada.

Esse intercepto é todo o prêmio. Se, após eliminar todos os fatores de risco conhecidos, sua estratégia ainda mostrar um alfa positivo e estatisticamente significativo, você encontrou algo real. Se o alfa desaparece no momento em que você considera os fatores, você nunca teve vantagem. Você tinha beta disfarçado de genialidade.

Michael Jensen primeiro enquadrou a habilidade dessa forma em 1968, quando testou se os gestores de fundos mútuos poderiam realmente superar o mercado. Ele executou essa regressão exata e fez uma pergunta. O intercepto é diferente de zero? Quase sessenta anos depois, esta ainda é a forma como o desempenho institucional é julgado. É chamado de alfa de Jensen, e é a base da disciplina.

**Portanto, quando você constrói um sinal, seu trabalho nunca é maximizar o retorno bruto.

É produzir um intercepto positivo que sobreviva após os fatores conhecidos terem sido removidos. Segure isso. Todo o resto serve a isso.**

Parte 3: Construindo Seu Primeiro Sinal do Zero

Roan - inline image

Um sinal real mede o alfa somente depois que cada fator conhecido foi eliminado.

Vamos construir o modelo real mais simples e, em seguida, torná-lo de nível institucional. Suponha que você acredita que o retorno de um ativo pode ser parcialmente previsto por um fator. O retorno anterior de um ativo relacionado, uma medida de momentum, uma métrica de valor. A regressão de fator único é:

rₜ = α + β Xₜ + εₜ

Em Python, são algumas linhas, e o intercepto é a parte que você nunca deve pular:

python
1import statsmodels.api as sm
2
3# X é sua série de fatores, y é o retorno do ativo que você quer explicar
4X = sm.add_constant(X) # ESTA linha cria seu intercepto alfa
5modelo = sm.OLS(y, X).fit()
6print(modelo.summary())

Essa linha add_constant não é uma formalidade. É a linha que cria seu termo alfa. Esqueça-a e você força a linha a passar por zero, jogando fora o número mais importante de toda a saída.

Mas o mundo real nunca tem um único fator. Um sinal sério leva em conta muitas influências ao mesmo tempo. Esse é o modelo multifatorial:

rₜ = α + β₁X₁ₜ + β₂X₂ₜ + ... + βₖXₖₜ + εₜ

Cada beta agora mede o efeito de seu próprio fator, mantendo todos os outros constantes. Essa frase, "mantendo os outros constantes", é o superpoder silencioso da regressão. Ela isola a contribuição única de cada fator e elimina a sobreposição. Quando você regride os retornos de sua estratégia contra os fatores estabelecidos, mercado, tamanho, valor, momentum, qualquer alfa que restar naquele intercepto é a fatia de sua vantagem que nenhum dos fatores conhecidos pode explicar.

python
1import statsmodels.api as sm
2
3# fatores é um DataFrame, cada coluna um fator, alinhado aos retornos y
4X = sm.add_constant(fatores)
5modelo = sm.OLS(y, X).fit()
6
7alfa = modelo.params['const'] # sua vantagem candidata
8p_alfa = modelo.pvalues['const'] # o quanto confiar nela
9print("Alfa:", round(alfa, 5))
10print("P-valor do alfa:", round(p_alfa, 4))

Esse intercepto residual é seu sinal candidato. Tudo daqui em diante é sobre provar se ele é real.

É exatamente aqui que a maioria dos tutoriais públicos para, e onde o trabalho institucional realmente começa. A construção do fator, a neutralização, os esquemas de ponderação que transformam um sinal bruto em um livro de negociações. Se você quiser ver exatamente como uma empresa como a AQR transforma essas regressões em um portfólio de fatores ao vivo, essa análise é onde eu levo tudo até o fim.

Parte 4: Lendo a Saída Como um Pesquisador Institucional

Roan - inline image

O profissional não pergunta quão grande é o retorno. Ele pergunta quão confiante está de que não é um acidente.

Quando você executa esse resumo, a maioria das pessoas olha para um número e segue em frente. Um pesquisador treinado o lê como um relatório de diagnóstico. Aqui está o que realmente importa.

O coeficiente e seu sinal. Cada beta fornece direção e força. Antes de confiar em qualquer número, pergunte se o sinal faz sentido econômico. Se seu modelo diz para comprar quando algo está mais caro e você não consegue explicar por quê, você encontrou uma casualidade, não um fator.

O p-valor. Este é o coração de tudo. Ele responde a uma pergunta. Se este fator realmente não tivesse efeito, qual é a probabilidade de eu ver uma relação tão forte puramente por acaso? Um p-valor de 0,62 significa 62% de chance de você estar olhando para sorte aleatória. Abaixo de 0,05 é a barreira convencional para levar um resultado a sério. Um quant olhando para um modelo falho com p-valor de 0,62 não está olhando para um sinal fraco. Ele está olhando para ruído puro.

R-quadrado. A fração da variação do retorno que seu modelo explica, e aqui está a parte que vira os iniciantes de cabeça para baixo. Na previsão de retornos, um R-quadrado alto geralmente é um aviso, não um troféu. Sinais de retorno reais são fracos. Um R-quadrado de 0,01 ou 0,02 pode ser extremamente lucrativo se for persistente e real. Se você vir 0,9 em uma previsão de retorno, quase certamente tem viés de olhar para frente ou está regredindo algo contra si mesmo por acidente.

A estatística t. O coeficiente dividido por seu erro padrão. Uma regra aproximada é que uma estatística t acima de 2 em valor absoluto corresponde ao limiar de 0,05. Pesquisadores sérios exigem 3 ou mais em um sinal novo, precisamente porque sabem quantos sinais testaram silenciosamente antes deste.

Você pode extraí-los diretamente em vez de ler a tabela inteira:

python
1print("Estatísticas t:\n", modelo.tvalues)
2print("P-valores:\n", modelo.pvalues)
3print("R-quadrado:", round(modelo.rsquared, 4))

Internalize a mudança. O iniciante pergunta quão grande é o retorno. O profissional pergunta quão confiante estou de que esse retorno não é um acidente. Essa única mudança na pergunta é toda a diferença.

Parte 5: Os Testes Que Separaram o Sinal Real do Ruído, e Por Que os Sinais Morrem

Roan - inline image

Execute cada candidato pela mesma provação. Quase nada sobrevive, e esse é o objetivo.

Aqui está a verdade brutal. Se você testar sinais aleatórios suficientes, alguns parecerão lucrativos por pura sorte. Teste 100 sinais inúteis no nível de 0,05 e cerca de 5 passarão apenas por sorte. Este é o problema de testes múltiplos e é a razão número um pela qual os backtests mentem. Veja como as mesas sérias se defendem contra isso.

Teste fora da amostra. Nunca julgue um sinal com os dados nos quais você o construiu. Divida seu histórico. Construa na primeira parte, teste em uma parte que o modelo nunca viu. Um sinal real sobrevive à travessia. Uma fantasia ajustada desmorona no instante em que encontra dados novos. Inegociável.

python
1divisao = int(len(y) * 0.8)
2X_treino, X_teste = X[:divisao], X[divisao:]
3y_treino, y_teste = y[:divisao], y[divisao:]
4
5modelo = sm.OLS(y_treino, X_treino).fit()
6prev_fa = modelo.predict(X_teste) # testa em dados não vistos

Coeficiente de Informação. Pesquisadores de fatores institucionais raramente vivem ou morrem por uma única regressão. Eles calculam o IC, a correlação entre o valor de um fator e o retorno futuro real, repetidamente ao longo do tempo. Um fator com um IC médio acima de aproximadamente 0,03 a 0,05 que se mantém estável em muitos períodos vence um único backtest magnífico todas as vezes. Estabilidade entre regimes é o verdadeiro indicador.

Erros padrão de Newey-West. Dados financeiros quebram uma suposição central do OLS porque retornos e volatilidade se aglomeram no tempo. P-valores brutos mentirão, geralmente lisonjeando seu sinal. Newey-West corrige seus erros padrão para isso. Usá-lo marca silenciosamente alguém que sabe o que está fazendo.

python
1# Significância corrigida por Newey-West, o padrão institucional
2modelo = sm.OLS(y, X).fit(cov_type='HAC', cov_kwds={'maxlags': 5})
3print(modelo.summary())

Correção para testes múltiplos. Se você testou 50 sinais, não pode julgar o vencedor pela barreira normal. A defesa simples é Bonferroni, dividindo seu limiar pelo número de coisas que você testou. Testou 50 sinais? Exija um p-valor abaixo de 0,001, não 0,05. É brutal, e esse é o objetivo. Força a honestidade sobre quantas vezes você foi pescar.

Execute um candidato através da validação fora da amostra, um IC estável, significância Newey-West e uma correção para testes múltiplos, e se ele ainda estiver de pé, você tem algo que a maioria dos traders de varejo nunca produz em suas vidas. Um sinal em que você genuinamente ganhou o direito de confiar.

Mas entenda a verdade final. Até mesmo um sinal real decai. Alfa vive na ineficiência do mercado, e no momento em que um sinal é conhecido e negociado, a própria negociação empurra a ineficiência para longe. Pesquisas recentes sobre aglomeração de fatores mostram que sinais mecânicos e facilmente copiados, como momentum simples, decaem ao longo de uma curva previsível e acentuada à medida que o capital se acumula, e que essa aglomeração se acelerou drasticamente quando o investimento em fatores se tornou barato através de ETFs. Os sinais mais simples são os mais aglomerados e morrem mais rápido. A vantagem durável vive em sinais que exigem trabalho real para serem construídos e em um processo de pesquisa que produz novos mais rápido do que os antigos se desgastam. É por isso que a Renaissance nunca parou de pesquisar por um único dia em trinta anos.

Trabalho de casa: Pegue um sinal em que você acredita atualmente. Execute-o nos 20% mais recentes de seus dados, que você fingirá que nunca viu. Se o alfa desaparecer, você acabou de economizar dinheiro real. É o teste mais valioso que você jamais executará.

Parte 6: O Que Você Acabou de Construir, do Início ao Fim

Roan - inline image

Cada sinal real se desgasta à medida que fica aglomerado. O motor de pesquisa que os substitui é a vantagem real.

Recue e observe a máquina completa que você agora tem, porque as peças se conectam em um pipeline limpo.

Você começa com um fator, qualquer coisa que você acredita conter informações sobre retornos futuros. Você regride os retornos de seu ativo nesse fator com OLS, sempre incluindo o intercepto, e esse intercepto é seu alfa candidato. Você expande para uma regressão multifatorial para que seu alfa seja medido somente após os fatores de risco conhecidos, mercado, tamanho, valor, momentum, terem sido eliminados. O que resta no intercepto é vantagem pura e inexplicada.

Então você o interroga. Você lê o p-valor para perguntar se pode ser sorte. Você verifica o sinal quanto ao sentido econômico. Você ignora o sedutor R-quadrado alto e respeita o pequeno e honesto. Você valida fora da amostra em dados que o modelo nunca tocou. Você calcula o Coeficiente de Informação em muitos períodos para confirmar que é estável, não uma casualidade única. Você corrige seus erros padrão com Newey-West para que a estrutura temporal dos mercados não o engane. E você aplica uma correção para testes múltiplos para que o número de sinais que você testou não possa fabricar um vencedor falso.

O que sai do outro lado não é um palpite. É um sinal com uma vantagem medida, um nível de confiança conhecido, prova de que sobrevive em dados não vistos e uma contabilidade honesta de quão provável é que seja real. Essa é a diferença entre a pessoa cujo modelo morre em duas semanas e a pessoa que constrói algo que se sustenta.

E aqui está como realmente se ganha dinheiro. Um sinal com uma vantagem pequena, mas genuína e estável, negociada em muitas oportunidades independentes, se compõe. A Renaissance estava certa pouco mais da metade das vezes e transformou isso na maior fortuna da história do mercado, porque a vantagem era real, era repetível, e eles a dimensionaram corretamente em um número enorme de apostas. Você agora está trabalhando a partir do mesmo modelo. Construa o sinal, prove que é real, dimensione-o de forma sensata e substitua-o no momento em que seu IC começar a desaparecer.

Esse loop de substituição é a carreira inteira. Um sinal é uma negociação. Um processo de pesquisa que continua produzindo sinais reais mais rápido do que eles decaem é uma franquia.

O Resumo

A regressão linear não é a ferramenta chata que você pulou. Ela desenha a melhor linha através de seus dados, define o que alfa realmente é, constrói seu primeiro sinal real, testa se esse sinal é genuíno ou ruído e avisa quando o sinal começa a morrer.

Alfa é o intercepto que sobrevive depois que todo fator de risco conhecido é removido. Você constrói um candidato com OLS, primeiro fator único, depois multifatorial. Você lê a saída como um pesquisador, onde o p-valor e a estabilidade importam mais do que o tamanho do retorno. Você se defende contra a armadilha de testes múltiplos com validação fora da amostra, um Coeficiente de Informação estável, erros Newey-West e uma correção para quantos sinais você testou. E você aceita que todo sinal real decai, o que significa que a verdadeira vantagem é o motor de pesquisa, não qualquer modelo único. O mesmo motor que construiu o maior fundo da história.

O quant olhando para um Sharpe de 0,03 e um p-valor de 0,62 não é azarado. Ele pulou a disciplina deste artigo. Não seja ele.

Aqui está a pergunta com a qual quero que você reflita.

Se o alfa real decai no momento em que se torna amplamente conhecido, então publicar um sinal o destrói, enquanto ocultar um sinal significa que ele ainda morre lentamente à medida que outros o descobrem independentemente.

Então, de onde vem a vantagem durável? Dos próprios sinais, ou da velocidade do processo de pesquisa que os substitui?

Sua resposta revela se você pensa como um trader em busca de uma grande vitória, ou como um quant construindo uma máquina que imprime vantagem por décadas.

Deixe sua resposta nos comentários. Não há resposta errada. Mas há respostas muito reveladoras.

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais