Observabilidade de agentes de código: o que registrar em cada sessão
Publicado em
Agentes de código já entregam ganho mensurável de produtividade. O diferencial de quem escala isso em empresa não é “usar IA” — é registrar cada sessão de ponta a ponta: o pedido, os passos executados, o modelo usado, o custo, o resultado e a autoria. Essa trilha transforma velocidade em operação auditável: governança, custo controlável, melhoria contínua e autonomia sob supervisão humana.
Por que a sessão precisa deixar trilha
Agentes de código não são autocomplete. Eles planejam, chamam ferramentas, leem repositórios, alteram arquivos e encadeiam decisões. Sem registro, a organização ganha throughput e perde a capacidade de responder a três perguntas básicas:
- O que foi pedido e por quem?
- O que o agente fez, com qual modelo e a que custo?
- O que entrou em produção — e quem aprovou?
Essas perguntas não são detalhe de ferramenta. Elas são o mínimo para tratar IA no desenvolvimento como sistema confiável, e não como caixa-preta.
O NIST AI Risk Management Framework (AI RMF 1.0) coloca accountable and transparent entre as características de IA confiável. No texto do framework, accountability pressupõe transparência: informação adequada sobre o sistema e seus outputs, em cada estágio do ciclo de vida, para os atores certos. Em desenvolvimento de software, isso se traduz em trilha de sessão — não em slide de política.
O que registrar em cada sessão
Uma sessão de agente de código começa no pedido e termina no resultado aceito (ou rejeitado). O registro útil cobre seis campos. Cada um responde a uma decisão de negócio.
Pedido
O enunciado da tarefa, o contexto disponível (repositório, branch, tickets) e quem solicitou. Sem o pedido, não há como auditar se o agente resolveu o problema certo.
Passos
A sequência de ações: planejamento, leitura de arquivos, chamadas a ferramentas, diffs propostos, testes executados, retries. Passos são o equivalente operacional do trace: mostram o caminho, não só o fim.
Convenções abertas já descrevem essa forma. As semantic conventions GenAI do OpenTelemetry para agentes padronizam spans como invoke_agent, plan e execute_tool, com atributos de modelo, tokens e erros. Instrumentar a sessão nessa linha evita inventar um dialeto proprietário só para o time interno.
Modelo
Qual modelo (ou conjunto de modelos) rodou em cada passo. Modelo muda qualidade, latência, custo e perfil de risco. Sem esse campo, revisões periódicas viram opinião.
Custo
Tokens de entrada e saída, e o custo em dinheiro por geração e por sessão. Na prática de observabilidade de LLM, uso e custo são observados por geração e agregados por modelo, caso de uso e período — como documentam as práticas de token and cost tracking. Em empresa, isso vira orçamento de IA que o CFO entende.
Resultado
O artefato produzido (diff, PR, relatório), o status (aceito, rejeitado, rollback) e a evidência de verificação (testes, revisão humana). Resultado sem veredito não fecha a sessão.
Autoria
Quem pediu, qual agente executou, quem supervisionou e quem promoveu para produção. Autoria fecha o ciclo de accountability: responsabilidade não some quando a IA escreve o código.
Evidência a favor: IA acelera — e supervisão eleva o resultado
A produtividade com assistência de IA já foi medida em condições controladas. No experimento de Peng, Kalliamvakou, Cihon e Demirer (2023) com GitHub Copilot, desenvolvedores com acesso ao assistente concluíram uma tarefa padronizada de programação 55,8% mais rápido do que o grupo de controle (arXiv:2302.06590). O resultado é o ponto de partida: a IA funciona como acelerador.
O segundo resultado fecha o argumento enterprise. No estudo controlado HiLDe (human-in-the-loop decoding), participantes que influenciavam decisões críticas do modelo durante a geração geraram, em média, 31% menos vulnerabilidades do que com um assistente convencional (média 2,67 vs. 3,89; p = 0,01) — e concentraram 71% das correções intencionais de segurança no modo com humano no loop (Anaya González, Rothkopf, Lerner e Polikarpova, 2025).
Leitura conjunta, sem ambiguidades: IA acelera; supervisão humana ativa melhora a qualidade do que entra. Observabilidade de sessão é o que torna essa combinação operacional em escala — o time só supervisiona, orça e melhora o que consegue ver.
O que isso muda na empresa
Governança e auditoria
Com pedido, passos, modelo, custo, resultado e autoria, a liderança responde a auditoria interna, risco e compliance sem reconstruir a história a partir de chat. Transparência deixa de ser princípio e vira dado.
Custo controlado
Sessões sem custo agregado viram fatura surpresa. Com custo por modelo e por tipo de tarefa, o time corta caminhos caros, escolhe modelo por criticidade e define tetos — sem frear a operação no escuro.
Melhoria contínua
Revisões periódicas usam a trilha: quais prompts falham, quais ferramentas erram, onde o humano rejeita, onde o modelo é excessivo. Sem trilha, a “melhoria de uso de IA” vira anedota.
Autonomia com segurança
A Ithaca opera agentes de código no nível 4 da escala descrita por Dan Shapiro (e adotada em dark factory): a IA executa; humanos supervisionam e leem o código. Isso não é dark factory — o nível 5, em que a especificação vira software sem leitura humana. A plataforma foi feita para parar no nível 4: o time do cliente define até onde a autonomia vai.
Como a plataforma materializa a trilha
A Ithaca é uma plataforma de desenvolvimento agentic que roda no ambiente do cliente. Os agentes de código registram cada ação com autoria. A observabilidade acompanha a sessão do pedido à resposta — duração, custo e o modelo de cada passo.
No legado, a mesma disciplina se aplica: a base de conhecimento lê o sistema existente antes de qualquer linha nova; o sistema novo nasce ao lado do antigo; a troca só ocorre depois de conferida. O método está descrito em Modernizar o legado sem parar a operação.
Exemplo operacional público (Dr. Consulta, plataforma de assinaturas com anos em produção): redução de 75% no custo de infraestrutura; uma feature que levava duas semanas passou a levar até três dias — exemplo representativo, não medição do backlog inteiro. Manutenção passou a ser supervisionada sobre a operação dos agentes, em vez de só trabalho manual.
Nenhum desses números substitui a trilha de sessão: eles ilustram o que vira possível quando a operação deixa de ser caixa-preta.
Da telemetria ao resultado de negócio
Registrar a sessão não é um fim em si. O valor aparece quando a trilha alimenta quatro rotinas que a liderança já reconhece.
Inventário e política. Sem inventário de sessões, não há como saber quantos agentes operam, em quais sistemas e com quais modelos. O inventário vira o ponto de partida da função Govern do NIST AI RMF: papéis claros, tolerância a risco documentada e revisão periódica.
Orçamento de IA. Custo por sessão, por repositório e por tipo de tarefa permite comparar: refatoração versus feature nova, modelo maior versus modelo menor, corrida automática versus sessão supervisionada. O time corta o que não entrega e reforça o que entrega — com número, não com feeling.
Incidentes e rollback. Quando um commit gerado por agente falha em produção, a pergunta deixa de ser “quem mexeu?” e passa a ser “qual sessão, quais passos, qual aprovação?”. Tempo de diagnóstico cai porque a causa já está indexada.
Capacitação do time. Revisões com a trilha na mesa ensinam o time a pedir melhor, a rejeitar melhor e a definir limites de autonomia com base no que a sessão realmente fez. Observabilidade vira material de treinamento, não só log.
Em outras palavras: a plataforma entrega velocidade e a torna mensurável, atribuível e corrigível — condição para escalar agentes de código em empresa grande sem transformar o ciclo de desenvolvimento em caixa-preta.
O que não confundir
Três confusões aparecem com frequência em conversas com C-level.
Observabilidade de agentes ≠ log de chat. Colar o histórico do assistente em um arquivo não basta. Falta estrutura: IDs, spans de ferramenta, modelo, tokens, status de aceitação e autoria de promoção.
Rastrear ≠ espionar o desenvolvedor. O objeto da medição é a sessão do agente e o artefato que entra no repositório — não a produtividade individual vista como vigilância. O objetivo é accountability do sistema de IA, alinhado ao que o NIST descreve como transparência adequada ao papel de cada ator.
Autonomia alta ≠ dark factory. Subir o grau de autonomia dos agentes de código só é responsável se humanos continuam lendo o código e se a sessão permanece auditável. Sem os dois, a organização cruza o limiar em que ninguém consegue sustentar o que foi escrito.
Com esses limites claros, a conversa deixa de ser “usar ou não usar IA” e passa a ser “sob quais condições a plataforma opera com segurança”.
Checklist rápido para o C-level
Antes de escalar agentes de código, confirme:
- Toda sessão tem ID e vínculo com quem pediu
- Passos (incluindo ferramentas) ficam armazenados pelo tempo de retenção definido
- Modelo e tokens/custo entram no mesmo registro
- Resultado inclui status de aceitação e evidência de verificação
- Autoria cobre pedido, execução, supervisão e promoção
- Humanos leem o código que entra em produção (nível 4, não dark factory)
- Dados e código permanecem no ambiente do cliente
Se algum item falha, há velocidade — mas ainda falta a medição que sustenta escala com governança.
FAQ
O que é observabilidade de agentes de código?
É o registro estruturado de cada sessão em que um agente de código atua: pedido, passos, modelo, custo, resultado e autoria. Serve para auditar, controlar gasto e melhorar o uso de IA com evidência.
Observabilidade de LLM é a mesma coisa que APM tradicional?
Não. APM clássico observa serviços, latência e erros de aplicação. Observabilidade de agentes de código cobre também planejamento, ferramentas, tokens, modelo e decisão humana — o ciclo completo da sessão agentic.
Precisa de padrão aberto ou um formato interno basta?
Formato interno funciona no curto prazo. Padrões abertos — como as convenções GenAI do OpenTelemetry para agentes — reduzem lock-in e facilitam integração com stacks de telemetria que a empresa já usa.
Como isso se relaciona com NIST AI RMF?
O AI RMF trata accountability e transparência como características de IA confiável e organiza atividades em Govern, Map, Measure e Manage. Registrar sessões é uma forma concreta de Measure e Manage no SDLC: há o que medir, há o que priorizar e há trilha para resposta a incidente.
- NIST AI RMF 1.0 (NIST AI 100-1)Accountability e transparência como características de IA confiável; funções Govern, Map, Measure e Manage.
- OpenTelemetry GenAI — agent spansPadrão aberto para spans de agentes (invoke_agent, plan, execute_tool) e atributos de uso.
- Langfuse — token and cost trackingPrática de mercado: registrar uso e custo por geração e por modelo para monitorar gasto.
- Peng, Kalliamvakou, Cihon e Demirer (2023)Evidência controlada de aceleração: 55,8% mais rápido com assistente de IA.
- Anaya González, Rothkopf, Lerner e Polikarpova (2025)Humano no loop: 31% menos vulnerabilidades (média 2,67 vs. 3,89; p = 0,01).
- Dan Shapiro (2026) — Five LevelsEnquadramento de indústria do nível 4 (especificação com leitura humana) contra o nível 5.
- Ithaca — Dark factoryDefinição de nível 4 contra dark factory.
- Ithaca — Modernizar legadoMétodo de legado e o caso Dr. Consulta (75%; feature de duas semanas para até três dias, exemplo representativo).

