Dia 01 — Agentes
Workflows Multiagentes em Produção: Governança, Sandboxing & Evals de Loop
Vini Lana · 1h 22m de vídeo · 2 min de leitura
O grande insight
Agentes não devem conhecer a lógica do seu negócio, apenas acionar um gateway seguro. A qualidade de um workflow multiagente não está na genialidade de um único modelo, mas na precisão do harness e na contenção dos loops.
“Quanto mais barato o modelo, mais importante é o harness. Quanto mais caro e eficiente o modelo, menos importante é o harness.” — Vini Lana
Em 28 segundos
Números do dia
- 72,4%
- do Haiku 5.5 em computer use
- 5,7×
- mais passos no loop pra mesma tarefa
- 4,8×
- mais tokens de output no mesmo benchmark
- 20%
- de corte no preço do Sonnet 5.5
contra 48,9% do GPT-6 Luna, o rival barato
mesma nota no benchmark
a nota esconde o custo
semanas após o lançamento, como ele previu
Conceitos do dia
- Harness agêntico
- A infraestrutura em volta do LLM que gerencia execução de ferramentas, memória de curto prazo, loops de repetição e limites de acesso. O modelo apenas decide; o harness executa no mundo real.
- Gateway de ferramentas
- Camada intermediária entre os agentes e as APIs corporativas. Centraliza autenticação, autorização por papel e regras de negócio, impedindo que o modelo acesse serviços para os quais não tem permissão.
- Micro-sandbox
- Ambiente de execução em memória ou micro-VM isolada onde o agente roda comandos shell e código sem risco de contaminar o host ou acessar credenciais confidenciais em caso de prompt injection.
- Evals de loop agêntico
- Bateria de testes rodada sobre um dataset interno de tarefas reais. Mede não apenas o acerto final, mas a quantidade de passos e o consumo de tokens que cada LLM gasta para completar o fluxo.
Resumo executivo
- 01
Agentes pessoais para desenvolvedores solo focam em autoaprendizado e conveniência, mas arquiteturas corporativas esbarram em governança de dados, letramento de equipe e manutenção contínua.
- 02
Harness genéricos com dezenas de ferramentas abertas aumentam a superfície para prompt injection, exigindo frameworks com sandboxes isolados e escopo estrito de ferramentas por agente.
- 03
Agentes devem atuar apenas como interfaces de conversação; as regras de negócio e autorizações precisam viver no backend através de um gateway unificado de ferramentas e MCPs.
- 04
Avaliar modelos para fluxos agênticos exige datasets internos com testes unitários, priorizando a contagem de passos no loop e consumo de tokens em vez de notas genéricas de benchmarks públicos.
O vídeo
O fluxo
A regra de negócio nunca entra no agente. Ele conversa com o gateway, e o gateway decide o que a empresa libera.
Deep dive
Solo Dev vs. Enterprise: A Tríade Crítica
Agentes pessoais como o Hermes funcionam bem para desenvolvedores solo com autoaprendizado local. Mas em empresas, a arquitetura esbarra em três barreiras: governança (rastreabilidade de prompts e outputs), letramento da equipe não técnica e manutenção previsível de prompts e conexões.
→ apliqueNão leve ferramentas de desenvolvedor solo direto para a empresa sem planejar governança, logs e sandbox prévio.
Harness Específico e Isolamento por Sandbox
Harness genéricos expõem centenas de ferramentas ao mesmo tempo, criando uma superfície enorme para prompt injection. Frameworks modernos como Eve ou Mastra isolam agentes em tarefas cirúrgicas, restringindo comandos em sandboxes controlados como o just-bash ou contêineres mínimos.
→ apliqueIsole cada agente em um sandbox estrito e exponha apenas as ferramentas necessárias para aquela função específica.
Separação de Interface e Regra de Negócio
O agente é apenas a interface conversacional; a regra de negócio precisa viver no backend. Um gateway central de ferramentas intercepta chamadas de MCP, gerencia permissões por perfil (vendas, jurídico, marketing) e permite trocar o framework do agente sem reescrever a lógica interna.
→ apliqueTrate agentes como camada de frontend. Nunca codifique regras de negócio diretamente dentro de prompts ou skills locais.
Avaliando LLMs: A Analogia do Taxista
Dois modelos podem tirar a mesma nota em um benchmark e chegar ao mesmo resultado final, mas um gasta 29 passos e o outro dá voltas por 166 etapas no loop agêntico. Avaliar LLMs para agentes exige medir o consumo de tokens e a rota mais curta em datasets criados com tarefas reais.
→ apliqueAo escolher um LLM para agentes, meça steps no loop e consumo de tokens por tarefa, não apenas acerto percentual.
A Hierarquia de Modelos no Workflow Agêntico
Workflows eficientes distribuem papéis: modelos de fronteira orquestram raciocínio complexo, modelos intermediários tocam tarefas multiagente e modelos baratos e rápidos cuidam de agentes efêmeros de tiro curto, mantendo a janela de contexto enxuta para controlar a fatura da API.
→ apliqueEspecialize o modelo por função no fluxo: não use o LLM mais caro para tarefas efêmeras que um modelo leve resolve em um passo.
Antes e depois
O que a maioria acha
- ×
Basta dar todas as ferramentas ao agente e deixar ele decidir o que chamar.
- ×
As regras de negócio e integrações devem ser configuradas dentro do agente.
- ×
Benchmarks públicos dizem qual modelo é o melhor para qualquer sistema.
- ×
Multiagentes exigem rodar o modelo mais inteligente e caro em todas as pontas.
O que a arquitetura exige
- →
Dar muitas ferramentas aumenta a área de ataque. Agentes em produção precisam de escopo mínimo e sandbox restritivo.
- →
O agente é apenas uma interface de usuário. Regras de negócio vivem no backend protegidas por um gateway de ferramentas.
- →
Modelos com a mesma nota podem dar cinco vezes mais voltas no loop agêntico. Apenas evals com dados próprios revelam a eficiência real.
- →
Agentes efêmeros e tarefas pontuais devem rodar em modelos baratos e rápidos, reservando o topo da fronteira para orquestração crítica.
Faça hoje
Do criador
Vini Lana@vinilana Engenheiro de software há mais de 18 anos e fundador da AI Coders Academy. Ensina desenvolvimento de sistemas e multiagentes com rigor de engenharia.
- cursoAgent Builder, turma fundadora ↗
A versão longa desta live: agente em produção no primeiro módulo, agent factory no segundo. Pra quem já tem agente rodando e precisa de governança e evals. Lista de espera, começa em novembro.
- comunidadeAI Coders Academy ↗
Plataforma com as aulas privadas que ele cita na live, incluindo a de evals. Pra quem quer acompanhar o Vini além do YouTube.
curadoria independente · nenhum criador pagou pra estar aqui
página do criador →Resumo independente. É o criador e quer ajustar algo? Fale com a gente.
Papers e recursos
- github
- github
- github
- github
#MultiAgents · #AgentWorkflows · #Sandboxing · #Evals · #ViniLana · #Architecture
