Insights

Observabilidade de agentes de código: o que registrar em cada sessão

Publicado em

Agentes de código já entregam ganho mensurável de produtividade. O diferencial de quem escala isso em empresa não é “usar IA” — é registrar cada sessão de ponta a ponta: o pedido, os passos executados, o modelo usado, o custo, o resultado e a autoria. Essa trilha transforma velocidade em operação auditável: governança, custo controlável, melhoria contínua e autonomia sob supervisão humana.

Por que a sessão precisa deixar trilha

Agentes de código não são autocomplete. Eles planejam, chamam ferramentas, leem repositórios, alteram arquivos e encadeiam decisões. Sem registro, a organização ganha throughput e perde a capacidade de responder a três perguntas básicas:

  1. O que foi pedido e por quem?
  2. O que o agente fez, com qual modelo e a que custo?
  3. O que entrou em produção — e quem aprovou?

Essas perguntas não são detalhe de ferramenta. Elas são o mínimo para tratar IA no desenvolvimento como sistema confiável, e não como caixa-preta.

O NIST AI Risk Management Framework (AI RMF 1.0) coloca accountable and transparent entre as características de IA confiável. No texto do framework, accountability pressupõe transparência: informação adequada sobre o sistema e seus outputs, em cada estágio do ciclo de vida, para os atores certos. Em desenvolvimento de software, isso se traduz em trilha de sessão — não em slide de política.

O que registrar em cada sessão

Uma sessão de agente de código começa no pedido e termina no resultado aceito (ou rejeitado). O registro útil cobre seis campos. Cada um responde a uma decisão de negócio.

Pedido

O enunciado da tarefa, o contexto disponível (repositório, branch, tickets) e quem solicitou. Sem o pedido, não há como auditar se o agente resolveu o problema certo.

Passos

A sequência de ações: planejamento, leitura de arquivos, chamadas a ferramentas, diffs propostos, testes executados, retries. Passos são o equivalente operacional do trace: mostram o caminho, não só o fim.

Convenções abertas já descrevem essa forma. As semantic conventions GenAI do OpenTelemetry para agentes padronizam spans como invoke_agent, plan e execute_tool, com atributos de modelo, tokens e erros. Instrumentar a sessão nessa linha evita inventar um dialeto proprietário só para o time interno.

Modelo

Qual modelo (ou conjunto de modelos) rodou em cada passo. Modelo muda qualidade, latência, custo e perfil de risco. Sem esse campo, revisões periódicas viram opinião.

Custo

Tokens de entrada e saída, e o custo em dinheiro por geração e por sessão. Na prática de observabilidade de LLM, uso e custo são observados por geração e agregados por modelo, caso de uso e período — como documentam as práticas de token and cost tracking. Em empresa, isso vira orçamento de IA que o CFO entende.

Resultado

O artefato produzido (diff, PR, relatório), o status (aceito, rejeitado, rollback) e a evidência de verificação (testes, revisão humana). Resultado sem veredito não fecha a sessão.

Autoria

Quem pediu, qual agente executou, quem supervisionou e quem promoveu para produção. Autoria fecha o ciclo de accountability: responsabilidade não some quando a IA escreve o código.

Evidência a favor: IA acelera — e supervisão eleva o resultado

A produtividade com assistência de IA já foi medida em condições controladas. No experimento de Peng, Kalliamvakou, Cihon e Demirer (2023) com GitHub Copilot, desenvolvedores com acesso ao assistente concluíram uma tarefa padronizada de programação 55,8% mais rápido do que o grupo de controle (arXiv:2302.06590). O resultado é o ponto de partida: a IA funciona como acelerador.

O segundo resultado fecha o argumento enterprise. No estudo controlado HiLDe (human-in-the-loop decoding), participantes que influenciavam decisões críticas do modelo durante a geração geraram, em média, 31% menos vulnerabilidades do que com um assistente convencional (média 2,67 vs. 3,89; p = 0,01) — e concentraram 71% das correções intencionais de segurança no modo com humano no loop (Anaya González, Rothkopf, Lerner e Polikarpova, 2025).

Leitura conjunta, sem ambiguidades: IA acelera; supervisão humana ativa melhora a qualidade do que entra. Observabilidade de sessão é o que torna essa combinação operacional em escala — o time só supervisiona, orça e melhora o que consegue ver.

O que isso muda na empresa

Governança e auditoria

Com pedido, passos, modelo, custo, resultado e autoria, a liderança responde a auditoria interna, risco e compliance sem reconstruir a história a partir de chat. Transparência deixa de ser princípio e vira dado.

Custo controlado

Sessões sem custo agregado viram fatura surpresa. Com custo por modelo e por tipo de tarefa, o time corta caminhos caros, escolhe modelo por criticidade e define tetos — sem frear a operação no escuro.

Melhoria contínua

Revisões periódicas usam a trilha: quais prompts falham, quais ferramentas erram, onde o humano rejeita, onde o modelo é excessivo. Sem trilha, a “melhoria de uso de IA” vira anedota.

Autonomia com segurança

A Ithaca opera agentes de código no nível 4 da escala descrita por Dan Shapiro (e adotada em dark factory): a IA executa; humanos supervisionam e leem o código. Isso não é dark factory — o nível 5, em que a especificação vira software sem leitura humana. A plataforma foi feita para parar no nível 4: o time do cliente define até onde a autonomia vai.

Como a plataforma materializa a trilha

A Ithaca é uma plataforma de desenvolvimento agentic que roda no ambiente do cliente. Os agentes de código registram cada ação com autoria. A observabilidade acompanha a sessão do pedido à resposta — duração, custo e o modelo de cada passo.

No legado, a mesma disciplina se aplica: a base de conhecimento lê o sistema existente antes de qualquer linha nova; o sistema novo nasce ao lado do antigo; a troca só ocorre depois de conferida. O método está descrito em Modernizar o legado sem parar a operação.

Exemplo operacional público (Dr. Consulta, plataforma de assinaturas com anos em produção): redução de 75% no custo de infraestrutura; uma feature que levava duas semanas passou a levar até três dias — exemplo representativo, não medição do backlog inteiro. Manutenção passou a ser supervisionada sobre a operação dos agentes, em vez de só trabalho manual.

Nenhum desses números substitui a trilha de sessão: eles ilustram o que vira possível quando a operação deixa de ser caixa-preta.

Da telemetria ao resultado de negócio

Registrar a sessão não é um fim em si. O valor aparece quando a trilha alimenta quatro rotinas que a liderança já reconhece.

Inventário e política. Sem inventário de sessões, não há como saber quantos agentes operam, em quais sistemas e com quais modelos. O inventário vira o ponto de partida da função Govern do NIST AI RMF: papéis claros, tolerância a risco documentada e revisão periódica.

Orçamento de IA. Custo por sessão, por repositório e por tipo de tarefa permite comparar: refatoração versus feature nova, modelo maior versus modelo menor, corrida automática versus sessão supervisionada. O time corta o que não entrega e reforça o que entrega — com número, não com feeling.

Incidentes e rollback. Quando um commit gerado por agente falha em produção, a pergunta deixa de ser “quem mexeu?” e passa a ser “qual sessão, quais passos, qual aprovação?”. Tempo de diagnóstico cai porque a causa já está indexada.

Capacitação do time. Revisões com a trilha na mesa ensinam o time a pedir melhor, a rejeitar melhor e a definir limites de autonomia com base no que a sessão realmente fez. Observabilidade vira material de treinamento, não só log.

Em outras palavras: a plataforma entrega velocidade e a torna mensurável, atribuível e corrigível — condição para escalar agentes de código em empresa grande sem transformar o ciclo de desenvolvimento em caixa-preta.

O que não confundir

Três confusões aparecem com frequência em conversas com C-level.

Observabilidade de agentes ≠ log de chat. Colar o histórico do assistente em um arquivo não basta. Falta estrutura: IDs, spans de ferramenta, modelo, tokens, status de aceitação e autoria de promoção.

Rastrear ≠ espionar o desenvolvedor. O objeto da medição é a sessão do agente e o artefato que entra no repositório — não a produtividade individual vista como vigilância. O objetivo é accountability do sistema de IA, alinhado ao que o NIST descreve como transparência adequada ao papel de cada ator.

Autonomia alta ≠ dark factory. Subir o grau de autonomia dos agentes de código só é responsável se humanos continuam lendo o código e se a sessão permanece auditável. Sem os dois, a organização cruza o limiar em que ninguém consegue sustentar o que foi escrito.

Com esses limites claros, a conversa deixa de ser “usar ou não usar IA” e passa a ser “sob quais condições a plataforma opera com segurança”.

Checklist rápido para o C-level

Antes de escalar agentes de código, confirme:

  • Toda sessão tem ID e vínculo com quem pediu
  • Passos (incluindo ferramentas) ficam armazenados pelo tempo de retenção definido
  • Modelo e tokens/custo entram no mesmo registro
  • Resultado inclui status de aceitação e evidência de verificação
  • Autoria cobre pedido, execução, supervisão e promoção
  • Humanos leem o código que entra em produção (nível 4, não dark factory)
  • Dados e código permanecem no ambiente do cliente

Se algum item falha, há velocidade — mas ainda falta a medição que sustenta escala com governança.

FAQ

O que é observabilidade de agentes de código?

É o registro estruturado de cada sessão em que um agente de código atua: pedido, passos, modelo, custo, resultado e autoria. Serve para auditar, controlar gasto e melhorar o uso de IA com evidência.

Observabilidade de LLM é a mesma coisa que APM tradicional?

Não. APM clássico observa serviços, latência e erros de aplicação. Observabilidade de agentes de código cobre também planejamento, ferramentas, tokens, modelo e decisão humana — o ciclo completo da sessão agentic.

Precisa de padrão aberto ou um formato interno basta?

Formato interno funciona no curto prazo. Padrões abertos — como as convenções GenAI do OpenTelemetry para agentes — reduzem lock-in e facilitam integração com stacks de telemetria que a empresa já usa.

Como isso se relaciona com NIST AI RMF?

O AI RMF trata accountability e transparência como características de IA confiável e organiza atividades em Govern, Map, Measure e Manage. Registrar sessões é uma forma concreta de Measure e Manage no SDLC: há o que medir, há o que priorizar e há trilha para resposta a incidente.

Solicitar implantação

Fontes
Solicitar implantação

Traga a plataforma para dentro de casa.

Escolha o que a plataforma assume primeiro: aquele projeto novo que está travado ou o sistema antigo que já virou um fardo. A implantação é feita lado a lado com o seu time.

Veja a plataforma funcionando

Só isso. Sem cadastro, sem newsletter.