30 dias de IA2 liberados

Dia 01 — Agentes

Workflows Multiagentes em Produção: Governança, Sandboxing & Evals de Loop

Vini Lana · 1h 22m de vídeo · 2 min de leitura

01

O grande insight

Agentes não devem conhecer a lógica do seu negócio, apenas acionar um gateway seguro. A qualidade de um workflow multiagente não está na genialidade de um único modelo, mas na precisão do harness e na contenção dos loops.

“Quanto mais barato o modelo, mais importante é o harness. Quanto mais caro e eficiente o modelo, menos importante é o harness.” — Vini Lana

02

Em 28 segundos

03

Números do dia

72,4%
do Haiku 5.5 em computer use

contra 48,9% do GPT-6 Luna, o rival barato

5,7×
mais passos no loop pra mesma tarefa

mesma nota no benchmark

Gemini 3.8 Flash · 166
GPT-6 Astra · 29
4,8×
mais tokens de output no mesmo benchmark

a nota esconde o custo

Flash · 143 mil
Astra · 30 mil
20%
de corte no preço do Sonnet 5.5

semanas após o lançamento, como ele previu

04

Conceitos do dia

Harness agêntico
A infraestrutura em volta do LLM que gerencia execução de ferramentas, memória de curto prazo, loops de repetição e limites de acesso. O modelo apenas decide; o harness executa no mundo real.
Gateway de ferramentas
Camada intermediária entre os agentes e as APIs corporativas. Centraliza autenticação, autorização por papel e regras de negócio, impedindo que o modelo acesse serviços para os quais não tem permissão.
Micro-sandbox
Ambiente de execução em memória ou micro-VM isolada onde o agente roda comandos shell e código sem risco de contaminar o host ou acessar credenciais confidenciais em caso de prompt injection.
Evals de loop agêntico
Bateria de testes rodada sobre um dataset interno de tarefas reais. Mede não apenas o acerto final, mas a quantidade de passos e o consumo de tokens que cada LLM gasta para completar o fluxo.
05

Resumo executivo

  1. 01

    Agentes pessoais para desenvolvedores solo focam em autoaprendizado e conveniência, mas arquiteturas corporativas esbarram em governança de dados, letramento de equipe e manutenção contínua.

  2. 02

    Harness genéricos com dezenas de ferramentas abertas aumentam a superfície para prompt injection, exigindo frameworks com sandboxes isolados e escopo estrito de ferramentas por agente.

  3. 03

    Agentes devem atuar apenas como interfaces de conversação; as regras de negócio e autorizações precisam viver no backend através de um gateway unificado de ferramentas e MCPs.

  4. 04

    Avaliar modelos para fluxos agênticos exige datasets internos com testes unitários, priorizando a contagem de passos no loop e consumo de tokens em vez de notas genéricas de benchmarks públicos.

06

O vídeo

07

O fluxo

chamada MCPexecutaescopo mínimoUsuáriovendas, jurídico,marketingAgentesó interface deconversaGateway deferramentasauth, permissãopor papel, regrade negócioMicro-sandboxshell e códigoisoladosCRM, ERP,APIssó o que o papelpermite

A regra de negócio nunca entra no agente. Ele conversa com o gateway, e o gateway decide o que a empresa libera.

08

Deep dive

  1. Solo Dev vs. Enterprise: A Tríade Crítica

    Agentes pessoais como o Hermes funcionam bem para desenvolvedores solo com autoaprendizado local. Mas em empresas, a arquitetura esbarra em três barreiras: governança (rastreabilidade de prompts e outputs), letramento da equipe não técnica e manutenção previsível de prompts e conexões.

    → apliqueNão leve ferramentas de desenvolvedor solo direto para a empresa sem planejar governança, logs e sandbox prévio.

  2. Harness Específico e Isolamento por Sandbox

    Harness genéricos expõem centenas de ferramentas ao mesmo tempo, criando uma superfície enorme para prompt injection. Frameworks modernos como Eve ou Mastra isolam agentes em tarefas cirúrgicas, restringindo comandos em sandboxes controlados como o just-bash ou contêineres mínimos.

    → apliqueIsole cada agente em um sandbox estrito e exponha apenas as ferramentas necessárias para aquela função específica.

  3. Separação de Interface e Regra de Negócio

    O agente é apenas a interface conversacional; a regra de negócio precisa viver no backend. Um gateway central de ferramentas intercepta chamadas de MCP, gerencia permissões por perfil (vendas, jurídico, marketing) e permite trocar o framework do agente sem reescrever a lógica interna.

    → apliqueTrate agentes como camada de frontend. Nunca codifique regras de negócio diretamente dentro de prompts ou skills locais.

  4. Avaliando LLMs: A Analogia do Taxista

    Dois modelos podem tirar a mesma nota em um benchmark e chegar ao mesmo resultado final, mas um gasta 29 passos e o outro dá voltas por 166 etapas no loop agêntico. Avaliar LLMs para agentes exige medir o consumo de tokens e a rota mais curta em datasets criados com tarefas reais.

    → apliqueAo escolher um LLM para agentes, meça steps no loop e consumo de tokens por tarefa, não apenas acerto percentual.

  5. A Hierarquia de Modelos no Workflow Agêntico

    Workflows eficientes distribuem papéis: modelos de fronteira orquestram raciocínio complexo, modelos intermediários tocam tarefas multiagente e modelos baratos e rápidos cuidam de agentes efêmeros de tiro curto, mantendo a janela de contexto enxuta para controlar a fatura da API.

    → apliqueEspecialize o modelo por função no fluxo: não use o LLM mais caro para tarefas efêmeras que um modelo leve resolve em um passo.

09

Antes e depois

O que a maioria acha

  • ×

    Basta dar todas as ferramentas ao agente e deixar ele decidir o que chamar.

  • ×

    As regras de negócio e integrações devem ser configuradas dentro do agente.

  • ×

    Benchmarks públicos dizem qual modelo é o melhor para qualquer sistema.

  • ×

    Multiagentes exigem rodar o modelo mais inteligente e caro em todas as pontas.

O que a arquitetura exige

  • →

    Dar muitas ferramentas aumenta a área de ataque. Agentes em produção precisam de escopo mínimo e sandbox restritivo.

  • →

    O agente é apenas uma interface de usuário. Regras de negócio vivem no backend protegidas por um gateway de ferramentas.

  • →

    Modelos com a mesma nota podem dar cinco vezes mais voltas no loop agêntico. Apenas evals com dados próprios revelam a eficiência real.

  • →

    Agentes efêmeros e tarefas pontuais devem rodar em modelos baratos e rápidos, reservando o topo da fronteira para orquestração crítica.

10

Faça hoje

11

Do criador

Vini Lana@vinilana Engenheiro de software há mais de 18 anos e fundador da AI Coders Academy. Ensina desenvolvimento de sistemas e multiagentes com rigor de engenharia.

  • curso
    Agent Builder, turma fundadora ↗

    A versão longa desta live: agente em produção no primeiro módulo, agent factory no segundo. Pra quem já tem agente rodando e precisa de governança e evals. Lista de espera, começa em novembro.

  • comunidade
    AI Coders Academy ↗

    Plataforma com as aulas privadas que ele cita na live, incluindo a de evals. Pra quem quer acompanhar o Vini além do YouTube.

curadoria independente · nenhum criador pagou pra estar aqui

página do criador →

Resumo independente. É o criador e quer ajustar algo? Fale com a gente.

12

Papers e recursos

#MultiAgents · #AgentWorkflows · #Sandboxing · #Evals · #ViniLana · #Architecture

01/30Próximo · Claude Code & a Lição Amarga: Prompts, Mods e Verificação Pareto

Curadoria de Bruno Gonzaga