Kimi K3 Swarm Max: Como executar 300 agentes de pesquisa a partir de um único prompt

@choopyplug1
INGLÊShá 1 dia · 22 de jul. de 2026
105K
46
5
7
74

TL;DR

Este guia explica como aproveitar o recurso Swarm Max do Kimi K3 para executar 300 agentes paralelos em pesquisas complexas, enfatizando especificações estruturadas e etapas de verificação.

Kimi K3 foi lançado em 16 de julho de 2026. 2,8 trilhões de parâmetros. 1 milhão de tokens de contexto. O maior modelo de pesos abertos já lançado.

A funcionalidade principal é K3 Swarm Max: até 300 subagentes rodando em paralelo, coordenando-se em 4.000 passos, produzindo arquivos reais em vez de respostas de chat. Duas variantes compartilham o mesmo cérebro. O K3 Max lida com tarefas cotidianas. O K3 Swarm Max aponta uma frota para o problema.

chuplung - inline image

A maioria das pessoas abre o Kimi, digita uma pergunta, recebe uma resposta e fecha a aba. Isso representa cerca de 10% do que o produto faz. Este guia cobre os outros 90%.

chuplung - inline image

O swarm não é um complemento. O orquestrador é uma política aprendida treinada com Aprendizado por Reforço Multiagente Paralelo. Você descreve o objetivo. O swarm decide como dividi-lo, quantos agentes gerar e como unir os resultados novamente. Swarms se destacam em trabalhos amplos e paralelizáveis: pesquisa em mais de 50 fontes, análise em lote, monitoramento competitivo, construção de conjuntos de dados. Eles têm dificuldade em tarefas sequenciais profundas onde o passo 3 depende do passo 2.

chuplung - inline image
  • Escreva uma especificação, não um prompt

"Pesquisar o mercado de aplicativos de fitness" é a forma de queimar créditos e obter lixo. Um prompt de uma linha dá ao swarm permissão para decidir tudo. Ele decidirá errado.

chuplung - inline image

Trate o swarm como um contratado. Uma especificação define o que coletar, o que conta como válido, quais fontes são permitidas, o formato exato da saída e o que fazer em caso de conflito. A especificação é o artefato de maior alavancagem em todo o fluxo de trabalho, porque no Nível 2 ela se torna a semente da sua Skill reutilizável.

text
1# PROJETO: [nome]
2OBJETIVO: [uma frase, a entrega, não o tópico]
3ESCOPO: [o que está incluído, o que está explicitamente excluído]
4REGRAS: [validação, o que conta como descoberta verificada]
5FONTES: [posts oficiais, artigos, apenas primárias, sem agregadores]
6SAÍDA: [tipo de arquivo / quantidade / nomenclatura / detalhes de formato]
7EM CONFLITO: sinalizar a linha, nunca resolver silenciosamente
8CONDIÇÃO DE PARADA: [quando parar e relatar em vez de adivinhar]
  • Leia o plano de decomposição antes de gastar

Depois de enviar a especificação, o Kimi mostra o plano de execução antes de executar: quantos subagentes, o que cada um lida, a ordem de dependência, o orçamento de passos. Esta é a etapa que os iniciantes pulam, e é a mais cara de pular.

chuplung - inline image

Um swarm de 200 agentes decomposto incorretamente custa dinheiro real. Verificar o plano não custa nada. Você está procurando três coisas: ele entende o escopo, a contagem de agentes é razoável para a tarefa e o plano de saída corresponde ao que você realmente precisa.

text
1Mostre-me a decomposição proposta antes de executar:
2- quantos subagentes e o que cada um lida
3- a ordem de dependência (o que bloqueia o quê)
4- orçamento estimado de passos
5- onde está o maior risco de queda de qualidade
6NÃO execute ainda. Aguarde minha confirmação.

Um detalhe que vale a pena saber: os 4.000 passos são um orçamento total coordenado em todo o swarm, não 4.000 por agente. Uma execução com 300 agentes tem em média cerca de 13 passos cada. Isso diz se sua tarefa se encaixa no formato.

  • Execute

Agora você executa. Até 300 subagentes disparam em ondas paralelas, cada um em seu próprio contexto delimitado. Apenas a saída estruturada retorna ao coordenador.

text
1Execute a especificação do início ao fim.
2Paralize onde o plano permitir.
3Sinalize qualquer bloqueio imediatamente, não contorne silenciosamente.
4Mescle tudo na SAÍDA definida na especificação.

O que você tem após o Nível 1

Uma única saída do swarm construída a partir da sua especificação. Bruta, não verificada, mas estruturada. A maioria para por aqui. O valor começa no Nível 2.

chuplung - inline image
  • Exija arquivos reais, não uma resposta de chat

"Um relatório abrangente" dá permissão aos agentes para parar cedo. "Um PDF de 40 páginas + um CSV com 20.000 linhas + 14 gráficos PNG prontos para exportação" dá a eles um alvo de qualidade.

Lidere a especificação com a saída, sempre. A especificidade no nível da saída é a diferença entre uma equipe de pesquisa e uma caixa de sugestões cara.

text
1# exemplos de saída forte:
2SAÍDA: 1 .xlsx, uma linha por modelo, + resumo de 200 palavras
3SAÍDA: 30 arquivos HTML, um por loja, nomeados por negócio
4SAÍDA: PDF de 40 páginas + CSV de 20.000 linhas + 14 gráficos PNG
  • Exija arquivos reais, não uma resposta de chat

"Um relatório abrangente" dá permissão aos agentes para parar cedo. "Um PDF de 40 páginas + um CSV com 20.000 linhas + 14 gráficos PNG prontos para exportação" dá a eles um alvo de qualidade. Lidere a especificação com a saída, sempre. A especificidade no nível da saída é a diferença entre uma equipe de pesquisa e uma caixa de sugestões cara.

text
1# exemplos de saída forte:
2SAÍDA: 1 .xlsx, uma linha por modelo, + resumo de 200 palavras
3SAÍDA: 30 arquivos HTML, um por loja, nomeados por negócio
4SAÍDA: PDF de 40 páginas + CSV de 20.000 linhas + 14 gráficos PNG
  • Aponte um modelo separado para a saída

A falha conhecida do swarm: a menos que você exija explicitamente verificação, ele produz afirmações confiantes e mal citadas, e subagentes independentes às vezes se contradizem. "Parece pronto" e "está correto" são planetas diferentes.

Use um segundo modelo como porta de verificação. Seu único trabalho: refutar, não elogiar. Você não está pagando tokens premium para gerar. Você está pagando para pegar a falha silenciosa antes que o próximo passo salve o fluxo de trabalho como uma Skill reutilizável.

chuplung - inline image
text
1Você é o VERIFICADOR. Um swarm de agentes produziu a saída anexada.
2Seu único trabalho é encontrar o que está errado.
3
4Verifique:
5- Cada figura alegada remete a uma fonte nomeada?
6- Alguma seção contradiz outra?
7- Algo é apresentado como fato que na verdade é inferência?
8- A saída corresponde aos requisitos de formato da especificação?
9
10Para cada problema: cite a localização exata e a correção.
11Se tudo estiver correto: APROVADO.
12Se algo falhar: REJEITADO + a correção mais crítica primeiro.
  • Salve todo o fluxo de trabalho como uma Skill

Após uma execução verificada, diga ao Kimi para capturar todo o fluxo de trabalho: formato de entrada, etapas dos agentes, formato de saída, regras de validação. A primeira execução leva 20 minutos. Cada execução seguinte leva 30 segundos. A Skill é a razão pela qual o sistema se acumula em vez de reiniciar toda vez.

text
1Salve todo este fluxo de trabalho como uma Skill reutilizável: "[nome]"
2Capture:
3- formato de entrada (quais arquivos / formato de especificação que espera)
4- as etapas do agente que funcionaram
5- o formato de saída e convenção de nomenclatura
6- as regras de validação da especificação
7Na próxima vez que eu executar isso, anexo novos arquivos e obtenho o mesmo formato.

O que você tem após o Nível 2

Uma saída verificada em que você pode confiar e uma Skill salva que pode reproduzir sem reconstruir a especificação. É aqui que o loop começa a se acumular.

chuplung - inline image
  • Alimente seus próprios documentos como conhecimento do swarm

Skills capturam processo. Documento-para-Skill captura domínio. Carregue seu melhor trabalho e o Kimi captura sua impressão digital estrutural como uma skill que todo swarm futuro aplica.

chuplung - inline image

Cada PDF, transcrição ou planilha que você alimenta se torna contexto contra o qual todos os 300 agentes se baseiam, em vez de recorrer aos dados de treinamento. Quanto mais você alimenta, mais a saída se parece com seu trabalho, em vez de IA genérica.

text
1Capture este documento como uma skill reutilizável. Identifique o que o faz funcionar:
2- estrutura e ordem das seções
3- tom e registro de voz
4- profundidade da análise por seção
5Salve como "[nome]". Em seguida, produza um novo documento sobre [tópico diferente]
6usando a skill capturada. Corresponda ao padrão de qualidade, não ao conteúdo.
  • Transforme cada rejeição em uma regra permanente

A etapa de verificação pega uma falha uma vez. Esta etapa garante que o swarm nunca mais a cometa. Destile o feedback em regras rígidas e escreva-as em um arquivo de restrições que o swarm lê antes de fazer qualquer coisa.

text
1# RESTRICOES.md, carregado automaticamente
2- cada figura alegada deve remeter a uma fonte primária ou ser sinalizada
3- sem resolução silenciosa de conflitos: superfície contradições
4- [regra destilada do feedback do verificador da última execução]
5- [o erro que você nunca quer repetido]
6Bloqueio de escopo: não toque em nada fora do bloco ESCOPO da especificação.
  • Reproduza a skill em novas entradas

É aqui que "acumulação" deixa de ser um termo da moda e aparece na fatura. A execução dois não começa do zero. Ela começa a partir da skill, do conhecimento do swarm e do arquivo de restrições que você construiu acima. Mesmo fluxo de trabalho, novos arquivos, uma fração da configuração.

A economia muda drasticamente na reprodução. O preço de cache-hit do K3 cai para US$ 0,30 por milhão de tokens para contexto repetido, 10x mais barato que o preço de entrada da primeira execução. A skill, as restrições e a especificação são todo contexto repetido. Apenas seus novos arquivos de entrada custam a taxa total. A primeira execução é um investimento. Cada execução subsequente colhe o retorno.

chuplung - inline image

A saída também melhora estruturalmente. A Skill impõe o formato. As restrições bloqueiam todo erro que o verificador já pegou. O conhecimento do swarm fundamenta cada agente contra seus documentos reais em vez de dados de treinamento. A execução quatro não custa apenas menos que a execução um. Ela produz melhores resultados, porque o sistema aprendeu com três rodadas de feedback real.

chuplung - inline image
text
1Execute a skill salva "[nome]" nestas novas entradas.
2Aplique RESTRICOES.md. Use o formato de saída capturado.
3[anexar novos arquivos]
4
5Compare a saída desta execução com a última execução.
6Relate:
7- novas descobertas não presentes da última vez
8- descobertas que mudaram desde a última execução
9- qualquer coisa que desapareceu (sinalizar como possível lacuna)
10- desvios da forma esperada da skill

O que você tem após o Nível 3

Um pipeline de pesquisa que se autoaperfeiçoa. Cada execução é mais barata, mais rápida e mais precisa que a anterior porque a biblioteca de skills, a base de conhecimento e o arquivo de restrições continuam crescendo.

chuplung - inline image
  • Promova a skill para um agente programado

Assim que o loop estiver estável e apoiado por skill, você para de iniciá-lo manualmente. Aponte o Kimi para um gatilho: um cronograma, um novo arquivo, uma URL monitorada. Deixe-o executar todo o swarm proativamente, exibindo apenas a entrega e os desvios que merecem sua atenção.

chuplung - inline image

O monitoramento competitivo é o exemplo claro. Execução um: você constrói e verifica manualmente. Quando se torna um agente de fundo, ele verifica todos os concorrentes em paralelo semanalmente e deixa um resumo em sua caixa de entrada com custo de tempo marginal zero. O único humano restante no loop é a pergunta que você define e a decisão que toma sobre a resposta.

text
1Execute a skill "[nome]" em um cronograma semanal.
2Gatilho: [cronograma / novo arquivo / URL monitorada]
3Em cada execução: execute o swarm, aplique RESTRICOES.md,
4verifique, depois entregue a SAÍDA + uma diferença em relação à última execução.
5Apenas me notifique se um desvio ultrapassar [limite].

O que 2,8T parâmetros não corrigem

chuplung - inline image

A alucinação escala com o paralelismo. Mais agentes buscando significa respostas erradas mais confiantes, a menos que você execute uma passagem de verificação. O swarm não verifica os fatos por si só.

K3 custa 3-4x mais que K2.6. Entrada: US$ 3,00/M vs US$ 0,95/M. Saída: US$ 15,00/M vs US$ 4,00/M. O cache ajuda nas reproduções, mas a primeira execução é cara. Para otimização pura de custos, K2.6 ainda é a opção econômica.

Os pesos abertos ainda não foram lançados. A Moonshot prometeu até 27 de julho de 2026. Até lá, o K3 é executado apenas via API e no aplicativo Kimi.

Swarms amplificam especificações ruins. Um prompt vago através de um agente desperdiça uma janela de contexto. Através de 300 agentes, desperdiça 300 em paralelo.

A lista resumida

  • Prompts de uma linha. O swarm decide tudo. Ele decide errado.
  • Pular a revisão da decomposição. A etapa mais cara de pular.
  • Sem passagem de verificação. "Parece pronto" não é "está correto."
  • Salvar saída não verificada como skill. O erro se acumula em cada execução futura.
  • 300 agentes em uma tarefa sequencial. Um swarm não pode paralelizar uma cadeia de pensamento.
  • Usar K3 onde K2.6 é suficiente. Nem toda tarefa precisa de 2,8T parâmetros.

Conclusão

A maioria das pessoas abrirá o Kimi, digitará uma pergunta, fechará a aba. Essa é a caixa de chat. Isso é cerca de 10% do que o K3 faz.

Os outros 90% são uma equipe de pesquisa que você constrói uma vez e reproduz para sempre. Cada nível desbloqueia mais alavancagem: primeiro execução, depois confiança, depois acumulação, depois autonomia. Você não precisa de todos os quatro no primeiro dia. Comece no Nível 1 com uma especificação. Se a saída for útil, vá para o Nível 2 e verifique-a. Se planeja executar novamente, salve a Skill. O sistema fica mais afiado a partir daí por conta própria.

Escreva a especificação, não o prompt. Verifique antes de salvar. Então veja cada execução ficar mais barata e mais nítida que a anterior.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais