Como os modelos de IA aprendem novas habilidades e comportamentos?
O processo é surpreendentemente humano e fácil de entender, mesmo que você não tenha experiência em machine learning.
Colegas prestativos
Os modelos de IA, cada vez mais usados através de agentes, são parecidos com um colega prestativo. Quais características os melhores profissionais com quem você já trabalhou compartilham?
Talvez você tenha pensado em colegas que eram ótimos comunicadores, ou que tinham o discernimento para saber quando pedir ajuda versus quando resolver as coisas sozinhos. Existem também qualidades mais humanas, como ser agradável, empático e gentil. Mas eu gosto particularmente de trabalhar com pessoas que conseguem pegar problemas ambíguos e encontrar maneiras de resolvê-los.
Então, como fazemos um modelo agir como esse colega ideal? Precisamos primeiro escrever nossa versão do comportamento "correto". Esse documento é chamado de especificação do modelo, princípios, constituição ou similar. Ele é usado tanto para alinhamento interno quanto como diretriz para testar o comportamento do modelo (ou seja, evals) durante o treinamento.
Como melhoramos no que fazemos?
Minha simplificação excessiva é: tentar coisas difíceis, falhar, aprender e melhorar através da repetição.
Se você está integrando um novo colega de equipe, não espera que ele seja produtivo no primeiro dia. Ele precisa aprender a usar seus sistemas e ferramentas, e como sua equipe trabalha em conjunto. Os humanos, com todas as nossas imperfeições, somos muito bons em aprender novas habilidades (e lembrar delas).
Digamos que você queira se tornar o melhor jogador de basquete do mundo. Qual abordagem você deve adotar para melhorar suas habilidades?
- Ler tudo o que já foi escrito sobre o jogo de basquete. Vamos ignorar o fato de estarmos limitados a 24 horas por dia.
- Jogar 10.000 partidas de basquete. As mesmas regras de distorção do tempo se aplicam. Você aprende por tentativa e erro, revisando filmes, avaliando sua tomada de decisão e melhorando durante a prática.
Conhecimento e experiência são dois atributos diferentes e, idealmente, você quer maximizar ambos. Isso me lembra como as pessoas falam sobre "conhecimento teórico" versus "inteligência prática". Os melhores jogadores têm os dois.
Como aprendemos as coisas mais rápido? Com um treinador! O treinador ideal vai te observar jogar, te dizer o que consertar e sempre te desafiar contra seus limites atuais. Ele vai te ensinar como tomar decisões de alta qualidade quando você estiver sozinho, ajustando seus "pesos cerebrais" em direção a melhores decisões com o tempo.
Como os modelos aprendem?
Os modelos não aprendem exatamente como os humanos, mas o aprendizado humano fornece uma analogia útil.
Esses modelos começam aprendendo a prever padrões a partir de uma biblioteca enorme da experiência de outras pessoas (ou seja, pré-treinamento). Eles podem realmente ler todos os livros sobre basquete!
Após o pré-treinamento, você tem um modelo base. O modelo pode ser muito "teórico" (por exemplo, sabe tudo sobre história antiga), mas é imperfeito e tem algumas peculiaridades. Não é agradável conversar com ele e ele pode cometer erros.
Em seguida, você mostra ao modelo muitos exemplos do bom comportamento que deseja que ele imite (ou seja, fine-tuning supervisionado, ou SFT). Pense nisso como estudar filmes de grandes jogadores. Isso te leva longe, mas você não pode se tornar excelente apenas copiando os movimentos de outra pessoa.
Você precisa observar o modelo fazendo trabalho real para poder ajudá-lo a aprender e melhorar. Para moldar seu comportamento, você deixa o modelo jogar partidas simuladas e o recompensa quando ele vai bem (ou seja, aprendizado por reforço, ou RL). Essa recompensa é como o feedback de um treinador, onde você diz ao modelo se as decisões que ele tomou foram boas ou ruins, incentivando-o a melhorar com mais tentativas.
Uma nova pesquisa também sugere que qualidades mais generalizáveis, como a veracidade, podem ser aprendidas durante o RL. Se você ensinar o modelo a ser mais honesto ao responder perguntas de um domínio, valores como a honestidade podem ser generalizados ao responder qualquer pergunta.
Avaliando o modelo
Medimos se os modelos estão melhorando de duas maneiras principais: testes de prática onde eles podem revisar as respostas, e exames finais onde eles nunca viram as perguntas antes.
Seria difícil para os humanos saber se estamos melhorando em cálculo, por exemplo, sem testar a compreensão. Se você faz um teste e é reprovado, sabe exatamente onde precisa melhorar, mas isso só funciona quando o domínio sendo testado (por exemplo, matemática) tem um gabarito.
Um dos principais desafios para treinar grandes modelos de IA é criar um conjunto diversificado de "testes". Esses testes podem ser sobre qualquer coisa, desde matemática até programação. Se você conseguir criar um gabarito, os modelos podem tentar o teste várias vezes e aprender a melhorar.
E quanto a medir a inteligência em muitas tarefas diferentes? Pense nos exames de AP (Advanced Placement), que cobrem disciplinas desde cálculo até história. Muitos desses exames combinam questões de múltipla escolha corrigidas pela exatidão com questões dissertativas avaliadas com base em uma rubrica.
Isso é semelhante a como avaliamos modelos com benchmarks. Alguns benchmarks medem coisas objetivamente verificáveis (por exemplo, os testes foram aprovados?) e outros pedem a um modelo separado para avaliar os resultados usando uma rubrica (ou seja, LLM-como-juiz). Esses resultados fornecem uma referência para entender se o modelo está realmente aprendendo e melhorando durante o treinamento.
Criticamente, os benchmarks têm a intenção de testar tarefas não vistas ou "separadas". Caso contrário, seria um pouco como memorizar todas as respostas do seu teste e depois aparecer e escrevê-las de memória, o que não é uma verdadeira medida de inteligência.
Só inteligência não basta
Se você é um gênio, mas é rude e socialmente desatento, é provável que as pessoas não gostem de você.
Todos nós provavelmente podemos pensar em alguém que conhecemos assim. Não basta ser apenas inteligente! É por isso que alinhar os modelos para agir "corretamente" (de acordo com a especificação do modelo que definimos) é incrivelmente importante.
Imagine que você tivesse um amigo que terminava toda conversa com aquela enrolação de LLM agora popularizada, como "Sinceramente? Esse é o ponto". Você rapidamente se cansaria de conversar com ele.
Engenheiros e pesquisadores que treinam modelos passam um bom tempo conversando com um novo modelo antes que ele esteja pronto. Eles documentam todas as peculiaridades e pontos onde ele pode melhorar. Isso pode ser o uso excessivo de frases feitas como "No final das contas:" ou sacrificar a clareza por um tópico mais curto, levando a uma linguagem estranha e ininteligível com palavras excessivamente complexas.
Com os problemas identificados, eles podem então trabalhar para treinar ainda mais o modelo e penalizar comportamentos ruins, levando lentamente a um modelo com um comportamento mais alinhado. Além disso, eles podem fazer testes A/B do modelo em produção e medir se os usuários preferiram as respostas da nova versão e tiveram melhores resultados.
Aprendizado contínuo
Você pode esperar que esses modelos melhorem e se tornem mais inteligentes com o tempo.
Mas não é assim que eles funcionam hoje! O aprendizado só acontece quando o modelo está treinando. Suas conversas não atualizam a inteligência do modelo em tempo real.
Em vez disso, você precisa escrever as coisas para lembrar, normalmente como regras ou habilidades. Os agentes podem então ler esses arquivos e incluí-los no contexto ao solicitar o modelo.
Essa abordagem ingênua para a memória através de arquivos tem funcionado surpreendentemente bem, mas ainda há mais trabalho a ser feito antes que os agentes possam aprender e lembrar habilidades da mesma forma que um novo colega faria.
Ensinar modelos a serem prestativos é um tópico profundo. Espero que esta visão geral de alto nível tenha sido interessante o suficiente para inspirar você a aprender mais. Se você quiser ver mais explicações como esta, ou quiser que eu cubra outra parte com mais profundidade, me avise





