Agent Mentor Learn

Glossário

66 termos de “Verificação e garantia de qualidade: não deixe passar o que só “parece certo””. Passe o cursor sobre a primeira ocorrência na lição para ver a definição.

TermoDefiniçãoFonte
parece prontoO Claude para quando o trabalho parece pronto; sem uma verificação que ele possa rodar, “parece pronto” é o único sinal disponível no sistema inteiro.Best practices for Claude Code — Claude Code official documentation
loop de verificaçãoO papel que sobra para você quando não há nenhuma verificação executável no pipeline: todo erro fica esperando você notar.Best practices for Claude Code — Claude Code official documentation
trust-then-verify gapO nome oficial do fenômeno (lacuna do confiar-e-depois-verificar): o Claude produz uma implementação de aparência plausível que não lida com casos extremos; você confia primeiro, e a verificação ou não acontece ou acontece tarde demais.Best practices for Claude Code — Claude Code official documentation
afirmaçãoFrases em que você só pode escolher acreditar ou não: “a lógica está correta”, “deve estar tudo bem”, “já otimizado”, “nenhum erro durante a execução”.Best practices for Claude Code — Claude Code official documentation
evidênciaAlgo que uma segunda pessoa consegue re-executar exatamente da mesma forma: um comando mais sua saída bruta, um código de saída, uma lista de nomes de testes que falharam, uma captura de tela, uma comparação numérica antes/depois.Best practices for Claude Code — Claude Code official documentation
sistemas determinísticosEm computação, sistemas que produzem a mesma saída toda vez, dadas entradas idênticas; os verificadores deste curso são esse tipo de coisa “previsivelmente burra”, usando algo determinístico para avaliar algo não determinístico.Writing effective tools for agents — with agents — Anthropic Engineering
não determinísticoSistemas de agentes podem gerar respostas variadas mesmo com as mesmas condições iniciais; ainda que o prompt não mude um único caractere, não há garantia de que as decisões de duas execuções coincidam.Writing effective tools for agents — with agents — Anthropic Engineering
erros que se acumulamEm sistemas de agentes os erros fazem bola de neve: a falha de uma etapa faz os agentes explorarem trajetórias completamente diferentes, e eles tomam novas decisões com base em resultados ruins, levando a resultados imprevisíveis.How we built our multi-agent research system — Anthropic Engineering
ambientes sandboxOnde a Anthropic recomenda que agentes sejam testados com rigor: a autonomia significa custos mais altos e potencial de erros que se acumulam, então teste em sandboxes com os guardrails apropriados.Building Effective AI Agents — Anthropic Engineering
ground truthO feedback real que os agentes obtêm do ambiente durante a execução, como resultados de chamadas de ferramenta ou de execução de código, usado para avaliar o próprio progresso.Building Effective AI Agents — Anthropic Engineering
comprovadamente melhora os resultadosA condição de admissão para acrescentar complexidade: você deveria considerar adicionar complexidade apenas quando ela comprovadamente melhora os resultados.Building Effective AI Agents — Anthropic Engineering
stop_reasonO campo da resposta do modelo que dirige o loop do harness: quando o valor é tool_use, continue executando ferramentas e devolvendo os resultados; quando vira end_turn, o loop sai.Tool use with Claude — Claude API documentation
end_turnUm dos valores de stop_reason, significando que o modelo não planeja chamar mais ferramentas neste turno. Nada além disso.Tool use with Claude — Claude API documentation
tool_resultO bloco de mensagem que devolve ao modelo os resultados de execução de ferramenta, emparelhado com o tool_use correspondente pelo tool_use_id; é por aqui que a saída do verificador volta para a conversa.Tool use with Claude — Claude API documentation
run_checkEmbrulhar um script de verificação como uma ferramenta que o modelo pode chamar, deixando que ele mesmo rode a verificação dentro do loop e leia o resultado, com o código de saída e o stdout repassados como estão.Best practices for Claude Code — Claude Code official documentation
código de saídaComo scripts de verificação expressam a conclusão: 0 significa passa, não zero significa falha; a CI e o && do shell conseguem usar isso direto.Best practices for Claude Code — Claude Code official documentation
passa/falhaO resultado binário objetivo que uma verificação consegue produzir; com ele o loop se fecha sozinho — o Claude faz o trabalho, roda a verificação, lê o resultado e itera até passar.Best practices for Claude Code — Claude Code official documentation
fixtureUm arquivo de resposta padrão-ouro salvo de antemão; depois de rodar, você compara a saída com ele; é o que o script “compara a saída com um fixture” do cardápio oficial de verificações usa.Best practices for Claude Code — Claude Code official documentation
estado finalO método de julgamento padrão: não julgue se o agente seguiu um processo específico, julgue se ele alcançou o estado final correto.How we built our multi-agent research system — Anthropic Engineering
análise turno a turnoA abordagem que a avaliação de estado final substitui: conferir as ações do agente turno a turno, tentando validar cada etapa intermediária.How we built our multi-agent research system — Anthropic Engineering
checkpoint de verificaçãoAlguns poucos pontos de observação discretos em fluxos complexos, nos quais você verifica que “mudanças de estado específicas deveriam ter ocorrido”, em vez de validar cada etapa intermediária.How we built our multi-agent research system — Anthropic Engineering
checkpoint de recuperaçãoO sentido do Curso 9: gravar em disco o estado de execução do agente para que ele possa retomar dali depois de uma queda; a finalidade é recuperação, não julgamento.How we built our multi-agent research system — Anthropic Engineering
critérios de sucessoO conjunto de exigências que transforma “estado final correto” em números concretos ou julgamentos claros; se você não consegue escrevê-los de jeito nenhum, esta tarefa não deveria ter sido entregue inteira ao agente para rodar sozinho.Define success criteria and build evaluations — Claude API documentation
mensurávelA primeira exigência dura dos critérios de sucesso: use métricas quantitativas ou escalas qualitativas bem definidas; números trazem clareza e escalabilidade.Define success criteria and build evaluations — Claude API documentation
alcançávelA segunda exigência dura dos critérios de sucesso: baseie as metas em benchmarks do setor, experimentos anteriores, pesquisa de IA ou conhecimento de especialistas; elas não deveriam ser irrealistas para as capacidades atuais dos modelos de fronteira.Define success criteria and build evaluations — Claude API documentation
avaliação multidimensionalA maioria dos casos de uso precisa de avaliação ao longo de vários critérios de sucesso — as dimensões se minam entre si, sobrando menos espaço para atalhos.Define success criteria and build evaluations — Claude API documentation
asserção de trajetóriaUm acréscimo opcional: para um par prompt-resposta, especificar também quais ferramentas você espera que o agente chame, para medir se ele capta o propósito de cada ferramenta.Writing effective tools for agents — with agents — Anthropic Engineering
expectedToolsO campo opcional dos casos de eval que carrega a asserção de trajetória: espera-se que ele tenha tocado ao menos nestas ferramentas, independente de ordem ou contagem de chamadas.Writing effective tools for agents — with agents — Anthropic Engineering
chamadas de ferramenta redundantesUma métrica de diagnóstico: contagem de chamadas visivelmente alta normalmente sugere que os parâmetros de paginação ou de limite de tokens precisam ser redimensionados.Writing effective tools for agents — with agents — Anthropic Engineering
erros de ferramentaUma métrica de diagnóstico: muitos erros por parâmetros inválidos normalmente sugerem que essas ferramentas precisam de descrições mais claras ou de exemplos melhores.Writing effective tools for agents — with agents — Anthropic Engineering
correção por códigoPrimeiro lugar na ordenação dos métodos de correção: a mais rápida, a mais confiável, escala muitíssimo bem; a fraqueza é lhe faltar nuance para julgamentos complexos que precisam de menos rigidez baseada em regras.Define success criteria and build evaluations — Claude API documentation
correção por LLMSegundo lugar na ordenação: rápida, flexível, escalável, adequada a julgamento complexo; o pré-requisito é testar primeiro para garantir a confiabilidade e só então escalar.Define success criteria and build evaluations — Claude API documentation
correção humanaTerceiro lugar na ordenação: a mais flexível e de maior qualidade, mas lenta e cara; evite se possível.Define success criteria and build evaluations — Claude API documentation
correspondência exataA forma mais à esquerda no espectro de verificadores: mede se a saída do modelo bate com uma resposta correta predefinida, normalmente depois de normalizar espaços em branco e caixa.Define success criteria and build evaluations — Claude API documentation
output == golden_answerA forma mínima da correspondência exata, só uma checagem de igualdade; simples, sem ambiguidade, adequada a tarefas com respostas categóricas e bem delimitadas.Define success criteria and build evaluations — Claude API documentation
normalizaçãoAntes de comparar, apague as diferenças que não carregam significado: funda espaços em branco consecutivos, apare as pontas, uniformize a caixa; para valores, lave também símbolos de moeda, separadores de milhar e unidades.Define success criteria and build evaluations — Claude API documentation
verificador determinísticoA técnica central deste curso: usar código que dá a mesma conclusão toda vez para avaliar a saída de um sistema não determinístico, devolvendo passa/falha e motivos de falha legíveis.Writing effective tools for agents — with agents — Anthropic Engineering
espectroVerificadores não são algumas opções mutuamente exclusivas, e sim uma faixa contínua: uma ponta é a comparação exata de string com um fixture, a outra ponta é pedir ao Claude que julgue.Writing effective tools for agents — with agents — Anthropic Engineering
strict: trueUma linha acrescentada às definições de ferramenta, garantindo que as chamadas de ferramenta do Claude obedeçam estritamente ao schema que você declarou, adiantando uma classe de validação de estrutura para uma garantia da plataforma.Tool use with Claude — Claude API documentation
falso negativoO verificador julga uma saída correta como falha: ele não deixa erros passarem, ele acusa injustamente quem está certo.Writing effective tools for agents — with agents — Anthropic Engineering
verificador estrito demaisA forma mais comum de as verificações determinísticas falharem: por diferenças espúrias como formatação, pontuação ou formulações alternativas válidas, elas julgam respostas corretas como falhas.Writing effective tools for agents — with agents — Anthropic Engineering
texto livreSaídas como pesquisas e resumos: de forma livre, raramente com uma única resposta correta, difíceis de avaliar programaticamente; LLMs são um encaixe natural para pontuar esse tipo de saída.How we built our multi-agent research system — Anthropic Engineering
revisão humanaUma etapa que continua indispensável além do teste automatizado: os testes automatizados verificam a funcionalidade, mas garantir que as soluções se alinhem com requisitos mais amplos do sistema ainda precisa de olhos humanos.Building Effective AI Agents — Anthropic Engineering
juiz LLMUsar uma chamada de modelo para pontuar saídas em texto livre, posicionado onde as verificações determinísticas não alcançam, e não como substituto delas.How we built our multi-agent research system — Anthropic Engineering
rubricaQuebrar o vago “isto está bom” em várias perguntas concretas, respondendo e pontuando cada uma separadamente; para tarefas de pesquisa, a decomposição pronta são cinco dimensões.How we built our multi-agent research system — Anthropic Engineering
primeiro o raciocínio, depois a notaUma técnica crítica para prompts de juiz: fazer com que ele escreva o raciocínio antes de produzir a nota, e então descartar o raciocínio; isso aumenta o desempenho da correção, especialmente perceptível em julgamentos complexos.Define success criteria and build evaluations — Claude API documentation
contexto novoOnde o revisor deveria estar sentado: ele vê apenas a saída e os critérios que você deu, não consegue ver o raciocínio que produziu essa mudança, e por isso julga o resultado nos termos dele mesmo.Best practices for Claude Code — Claude Code official documentation
autorrelatoA descrição que o agente faz do próprio processo (“recuperei três fontes autoritativas e fiz verificação cruzada antes de confirmar a taxa”); sozinho, não conta como evidência.Writing effective tools for agents — with agents — Anthropic Engineering
transcrições brutasOs logs de execução incluindo chamadas de ferramenta e respostas de ferramenta, usados para pegar comportamento não descrito explicitamente na cadeia de raciocínio do agente.Writing effective tools for agents — with agents — Anthropic Engineering
achar problemasO primeiro modo de falha do juiz: um revisor instruído a encontrar lacunas normalmente vai reportar algumas, mesmo quando o trabalho está sólido — porque foi isso que você pediu a ele.Best practices for Claude Code — Claude Code official documentation
superengenhariaA consequência de perseguir cada achado da revisão: camadas extras de abstração, código defensivo e testes para casos que não podem acontecer.Best practices for Claude Code — Claude Code official documentation
tamanho de efeitoO tamanho da distância produzida por uma mudança — é um deslocamento de 71,2% para 72,4%, ou um salto de 30% para 80%; distâncias maiores exigem menos amostras.How we built our multi-agent research system — Anthropic Engineering
conjunto de avaliaçãoUm lote de tarefas emparelhadas com resultados verificáveis; a escala inicial oficial é de cerca de 20 consultas representando o uso real; não espere acumular centenas.How we built our multi-agent research system — Anthropic Engineering
resultado verificávelAquilo com que todo prompt de eval deve vir emparelhado: um estado final julgável, uma string, uma mudança de estado ou uma rubrica; sem isso o prompt não é uma tarefa de eval, é uma demo.Writing effective tools for agents — with agents — Anthropic Engineering
caso extremoSituações de baixa frequência mas que de fato ocorrem (informação faltando, pedidos misturados, erros de ferramenta); são o seguro do conjunto de avaliação, não o corpo dele.Define success criteria and build evaluations — Claude API documentation
priorize volume sobre qualidadeUm princípio de projeto de conjuntos de avaliação: mais perguntas com correção automatizada de sinal um pouco mais fraco é melhor do que menos perguntas com evals de alta qualidade corrigidos à mão por humanos.Define success criteria and build evaluations — Claude API documentation
distribuição realAquilo a que os evals devem se ater: as suas tarefas de avaliação devem estar ancoradas no uso do mundo real, a ponto de você apontar para qualquer prompt e dizer “três usuários perguntaram exatamente isso na semana passada”.Define success criteria and build evaluations — Claude API documentation
conjunto held-outUm lote de casos separado desde o início, que você não olha, não roda e não toca durante o ajuste do dia a dia; é nele que você se apoia para garantir que não houve overfitting nas avaliações de “treino”.Writing effective tools for agents — with agents — Anthropic Engineering
conjunto devO lote de casos rodado repetidamente no ajuste diário de prompts, quanto mais frequentemente melhor; as notas dele são navegação, não veredito.Writing effective tools for agents — with agents — Anthropic Engineering
overfittingToda a configuração de prompt mais ferramentas aprendeu as características do material de avaliação em vez das regularidades da própria tarefa — como fixar uma frase no system prompt por causa de um caso que vive falhando.Writing effective tools for agents — with agents — Anthropic Engineering
não é garantidoA formulação da documentação oficial para certos comportamentos ideais (como o modelo pedir espontaneamente os parâmetros obrigatórios que faltam); especialmente assim para prompts mais ambíguos e modelos menos capazes.Tool use with Claude — Claude API documentation
trilha de evalO programa executável que solda conjuntos de avaliação, correção estratificada e loops de harness: você digita um comando e as notas lhe dizem o que melhorou, o que ficou parado e se algo que estava certo quebrou.Writing effective tools for agents — with agents — Anthropic Engineering
cliente stubUm messages.create falso que devolve respostas numa ordem de fila fixa, transformando o comportamento do modelo em variável controlada e tornando a trilha inteira reprodutível.Writing effective tools for agents — with agents — Anthropic Engineering
fila de respostasA sequência de respostas pré-escrita por trás do cliente stub; a diferença entre duas versões de prompt fica fixada em duas filas, e “suponha que o prompt novo faça efeito e o modelo responda assim” está codificado como dado.Writing effective tools for agents — with agents — Anthropic Engineering
isolamento entre tarefasUma tarefa de eval, um loop independente, um messages independente; terminou, descarta; a implementação é apenas não içar messages para fora da função.Writing effective tools for agents — with agents — Anthropic Engineering
is_errorO marcador anexado ao tool_result ao devolver exceções de ferramenta: capture a exceção, embrulhe-a num resultado com esse marcador para devolver ao modelo, e incremente ao mesmo tempo o contador de erros.Tool use with Claude — Claude API documentation