Glossário
66 termos de “Verificação e garantia de qualidade: não deixe passar o que só “parece certo””. Passe o cursor sobre a primeira ocorrência na lição para ver a definição.
| Termo | Definição | Fonte |
|---|---|---|
| parece pronto | O Claude para quando o trabalho parece pronto; sem uma verificação que ele possa rodar, “parece pronto” é o único sinal disponível no sistema inteiro. | Best practices for Claude Code — Claude Code official documentation |
| loop de verificação | O papel que sobra para você quando não há nenhuma verificação executável no pipeline: todo erro fica esperando você notar. | Best practices for Claude Code — Claude Code official documentation |
| trust-then-verify gap | O nome oficial do fenômeno (lacuna do confiar-e-depois-verificar): o Claude produz uma implementação de aparência plausível que não lida com casos extremos; você confia primeiro, e a verificação ou não acontece ou acontece tarde demais. | Best practices for Claude Code — Claude Code official documentation |
| afirmação | Frases em que você só pode escolher acreditar ou não: “a lógica está correta”, “deve estar tudo bem”, “já otimizado”, “nenhum erro durante a execução”. | Best practices for Claude Code — Claude Code official documentation |
| evidência | Algo que uma segunda pessoa consegue re-executar exatamente da mesma forma: um comando mais sua saída bruta, um código de saída, uma lista de nomes de testes que falharam, uma captura de tela, uma comparação numérica antes/depois. | Best practices for Claude Code — Claude Code official documentation |
| sistemas determinísticos | Em computação, sistemas que produzem a mesma saída toda vez, dadas entradas idênticas; os verificadores deste curso são esse tipo de coisa “previsivelmente burra”, usando algo determinístico para avaliar algo não determinístico. | Writing effective tools for agents — with agents — Anthropic Engineering |
| não determinístico | Sistemas de agentes podem gerar respostas variadas mesmo com as mesmas condições iniciais; ainda que o prompt não mude um único caractere, não há garantia de que as decisões de duas execuções coincidam. | Writing effective tools for agents — with agents — Anthropic Engineering |
| erros que se acumulam | Em sistemas de agentes os erros fazem bola de neve: a falha de uma etapa faz os agentes explorarem trajetórias completamente diferentes, e eles tomam novas decisões com base em resultados ruins, levando a resultados imprevisíveis. | How we built our multi-agent research system — Anthropic Engineering |
| ambientes sandbox | Onde a Anthropic recomenda que agentes sejam testados com rigor: a autonomia significa custos mais altos e potencial de erros que se acumulam, então teste em sandboxes com os guardrails apropriados. | Building Effective AI Agents — Anthropic Engineering |
| ground truth | O feedback real que os agentes obtêm do ambiente durante a execução, como resultados de chamadas de ferramenta ou de execução de código, usado para avaliar o próprio progresso. | Building Effective AI Agents — Anthropic Engineering |
| comprovadamente melhora os resultados | A condição de admissão para acrescentar complexidade: você deveria considerar adicionar complexidade apenas quando ela comprovadamente melhora os resultados. | Building Effective AI Agents — Anthropic Engineering |
| stop_reason | O campo da resposta do modelo que dirige o loop do harness: quando o valor é tool_use, continue executando ferramentas e devolvendo os resultados; quando vira end_turn, o loop sai. | Tool use with Claude — Claude API documentation |
| end_turn | Um dos valores de stop_reason, significando que o modelo não planeja chamar mais ferramentas neste turno. Nada além disso. | Tool use with Claude — Claude API documentation |
| tool_result | O bloco de mensagem que devolve ao modelo os resultados de execução de ferramenta, emparelhado com o tool_use correspondente pelo tool_use_id; é por aqui que a saída do verificador volta para a conversa. | Tool use with Claude — Claude API documentation |
| run_check | Embrulhar um script de verificação como uma ferramenta que o modelo pode chamar, deixando que ele mesmo rode a verificação dentro do loop e leia o resultado, com o código de saída e o stdout repassados como estão. | Best practices for Claude Code — Claude Code official documentation |
| código de saída | Como scripts de verificação expressam a conclusão: 0 significa passa, não zero significa falha; a CI e o && do shell conseguem usar isso direto. | Best practices for Claude Code — Claude Code official documentation |
| passa/falha | O resultado binário objetivo que uma verificação consegue produzir; com ele o loop se fecha sozinho — o Claude faz o trabalho, roda a verificação, lê o resultado e itera até passar. | Best practices for Claude Code — Claude Code official documentation |
| fixture | Um arquivo de resposta padrão-ouro salvo de antemão; depois de rodar, você compara a saída com ele; é o que o script “compara a saída com um fixture” do cardápio oficial de verificações usa. | Best practices for Claude Code — Claude Code official documentation |
| estado final | O método de julgamento padrão: não julgue se o agente seguiu um processo específico, julgue se ele alcançou o estado final correto. | How we built our multi-agent research system — Anthropic Engineering |
| análise turno a turno | A abordagem que a avaliação de estado final substitui: conferir as ações do agente turno a turno, tentando validar cada etapa intermediária. | How we built our multi-agent research system — Anthropic Engineering |
| checkpoint de verificação | Alguns poucos pontos de observação discretos em fluxos complexos, nos quais você verifica que “mudanças de estado específicas deveriam ter ocorrido”, em vez de validar cada etapa intermediária. | How we built our multi-agent research system — Anthropic Engineering |
| checkpoint de recuperação | O sentido do Curso 9: gravar em disco o estado de execução do agente para que ele possa retomar dali depois de uma queda; a finalidade é recuperação, não julgamento. | How we built our multi-agent research system — Anthropic Engineering |
| critérios de sucesso | O conjunto de exigências que transforma “estado final correto” em números concretos ou julgamentos claros; se você não consegue escrevê-los de jeito nenhum, esta tarefa não deveria ter sido entregue inteira ao agente para rodar sozinho. | Define success criteria and build evaluations — Claude API documentation |
| mensurável | A primeira exigência dura dos critérios de sucesso: use métricas quantitativas ou escalas qualitativas bem definidas; números trazem clareza e escalabilidade. | Define success criteria and build evaluations — Claude API documentation |
| alcançável | A segunda exigência dura dos critérios de sucesso: baseie as metas em benchmarks do setor, experimentos anteriores, pesquisa de IA ou conhecimento de especialistas; elas não deveriam ser irrealistas para as capacidades atuais dos modelos de fronteira. | Define success criteria and build evaluations — Claude API documentation |
| avaliação multidimensional | A maioria dos casos de uso precisa de avaliação ao longo de vários critérios de sucesso — as dimensões se minam entre si, sobrando menos espaço para atalhos. | Define success criteria and build evaluations — Claude API documentation |
| asserção de trajetória | Um acréscimo opcional: para um par prompt-resposta, especificar também quais ferramentas você espera que o agente chame, para medir se ele capta o propósito de cada ferramenta. | Writing effective tools for agents — with agents — Anthropic Engineering |
| expectedTools | O campo opcional dos casos de eval que carrega a asserção de trajetória: espera-se que ele tenha tocado ao menos nestas ferramentas, independente de ordem ou contagem de chamadas. | Writing effective tools for agents — with agents — Anthropic Engineering |
| chamadas de ferramenta redundantes | Uma métrica de diagnóstico: contagem de chamadas visivelmente alta normalmente sugere que os parâmetros de paginação ou de limite de tokens precisam ser redimensionados. | Writing effective tools for agents — with agents — Anthropic Engineering |
| erros de ferramenta | Uma métrica de diagnóstico: muitos erros por parâmetros inválidos normalmente sugerem que essas ferramentas precisam de descrições mais claras ou de exemplos melhores. | Writing effective tools for agents — with agents — Anthropic Engineering |
| correção por código | Primeiro lugar na ordenação dos métodos de correção: a mais rápida, a mais confiável, escala muitíssimo bem; a fraqueza é lhe faltar nuance para julgamentos complexos que precisam de menos rigidez baseada em regras. | Define success criteria and build evaluations — Claude API documentation |
| correção por LLM | Segundo lugar na ordenação: rápida, flexível, escalável, adequada a julgamento complexo; o pré-requisito é testar primeiro para garantir a confiabilidade e só então escalar. | Define success criteria and build evaluations — Claude API documentation |
| correção humana | Terceiro lugar na ordenação: a mais flexível e de maior qualidade, mas lenta e cara; evite se possível. | Define success criteria and build evaluations — Claude API documentation |
| correspondência exata | A forma mais à esquerda no espectro de verificadores: mede se a saída do modelo bate com uma resposta correta predefinida, normalmente depois de normalizar espaços em branco e caixa. | Define success criteria and build evaluations — Claude API documentation |
| output == golden_answer | A forma mínima da correspondência exata, só uma checagem de igualdade; simples, sem ambiguidade, adequada a tarefas com respostas categóricas e bem delimitadas. | Define success criteria and build evaluations — Claude API documentation |
| normalização | Antes de comparar, apague as diferenças que não carregam significado: funda espaços em branco consecutivos, apare as pontas, uniformize a caixa; para valores, lave também símbolos de moeda, separadores de milhar e unidades. | Define success criteria and build evaluations — Claude API documentation |
| verificador determinístico | A técnica central deste curso: usar código que dá a mesma conclusão toda vez para avaliar a saída de um sistema não determinístico, devolvendo passa/falha e motivos de falha legíveis. | Writing effective tools for agents — with agents — Anthropic Engineering |
| espectro | Verificadores não são algumas opções mutuamente exclusivas, e sim uma faixa contínua: uma ponta é a comparação exata de string com um fixture, a outra ponta é pedir ao Claude que julgue. | Writing effective tools for agents — with agents — Anthropic Engineering |
| strict: true | Uma linha acrescentada às definições de ferramenta, garantindo que as chamadas de ferramenta do Claude obedeçam estritamente ao schema que você declarou, adiantando uma classe de validação de estrutura para uma garantia da plataforma. | Tool use with Claude — Claude API documentation |
| falso negativo | O verificador julga uma saída correta como falha: ele não deixa erros passarem, ele acusa injustamente quem está certo. | Writing effective tools for agents — with agents — Anthropic Engineering |
| verificador estrito demais | A forma mais comum de as verificações determinísticas falharem: por diferenças espúrias como formatação, pontuação ou formulações alternativas válidas, elas julgam respostas corretas como falhas. | Writing effective tools for agents — with agents — Anthropic Engineering |
| texto livre | Saídas como pesquisas e resumos: de forma livre, raramente com uma única resposta correta, difíceis de avaliar programaticamente; LLMs são um encaixe natural para pontuar esse tipo de saída. | How we built our multi-agent research system — Anthropic Engineering |
| revisão humana | Uma etapa que continua indispensável além do teste automatizado: os testes automatizados verificam a funcionalidade, mas garantir que as soluções se alinhem com requisitos mais amplos do sistema ainda precisa de olhos humanos. | Building Effective AI Agents — Anthropic Engineering |
| juiz LLM | Usar uma chamada de modelo para pontuar saídas em texto livre, posicionado onde as verificações determinísticas não alcançam, e não como substituto delas. | How we built our multi-agent research system — Anthropic Engineering |
| rubrica | Quebrar o vago “isto está bom” em várias perguntas concretas, respondendo e pontuando cada uma separadamente; para tarefas de pesquisa, a decomposição pronta são cinco dimensões. | How we built our multi-agent research system — Anthropic Engineering |
| primeiro o raciocínio, depois a nota | Uma técnica crítica para prompts de juiz: fazer com que ele escreva o raciocínio antes de produzir a nota, e então descartar o raciocínio; isso aumenta o desempenho da correção, especialmente perceptível em julgamentos complexos. | Define success criteria and build evaluations — Claude API documentation |
| contexto novo | Onde o revisor deveria estar sentado: ele vê apenas a saída e os critérios que você deu, não consegue ver o raciocínio que produziu essa mudança, e por isso julga o resultado nos termos dele mesmo. | Best practices for Claude Code — Claude Code official documentation |
| autorrelato | A descrição que o agente faz do próprio processo (“recuperei três fontes autoritativas e fiz verificação cruzada antes de confirmar a taxa”); sozinho, não conta como evidência. | Writing effective tools for agents — with agents — Anthropic Engineering |
| transcrições brutas | Os logs de execução incluindo chamadas de ferramenta e respostas de ferramenta, usados para pegar comportamento não descrito explicitamente na cadeia de raciocínio do agente. | Writing effective tools for agents — with agents — Anthropic Engineering |
| achar problemas | O primeiro modo de falha do juiz: um revisor instruído a encontrar lacunas normalmente vai reportar algumas, mesmo quando o trabalho está sólido — porque foi isso que você pediu a ele. | Best practices for Claude Code — Claude Code official documentation |
| superengenharia | A consequência de perseguir cada achado da revisão: camadas extras de abstração, código defensivo e testes para casos que não podem acontecer. | Best practices for Claude Code — Claude Code official documentation |
| tamanho de efeito | O tamanho da distância produzida por uma mudança — é um deslocamento de 71,2% para 72,4%, ou um salto de 30% para 80%; distâncias maiores exigem menos amostras. | How we built our multi-agent research system — Anthropic Engineering |
| conjunto de avaliação | Um lote de tarefas emparelhadas com resultados verificáveis; a escala inicial oficial é de cerca de 20 consultas representando o uso real; não espere acumular centenas. | How we built our multi-agent research system — Anthropic Engineering |
| resultado verificável | Aquilo com que todo prompt de eval deve vir emparelhado: um estado final julgável, uma string, uma mudança de estado ou uma rubrica; sem isso o prompt não é uma tarefa de eval, é uma demo. | Writing effective tools for agents — with agents — Anthropic Engineering |
| caso extremo | Situações de baixa frequência mas que de fato ocorrem (informação faltando, pedidos misturados, erros de ferramenta); são o seguro do conjunto de avaliação, não o corpo dele. | Define success criteria and build evaluations — Claude API documentation |
| priorize volume sobre qualidade | Um princípio de projeto de conjuntos de avaliação: mais perguntas com correção automatizada de sinal um pouco mais fraco é melhor do que menos perguntas com evals de alta qualidade corrigidos à mão por humanos. | Define success criteria and build evaluations — Claude API documentation |
| distribuição real | Aquilo a que os evals devem se ater: as suas tarefas de avaliação devem estar ancoradas no uso do mundo real, a ponto de você apontar para qualquer prompt e dizer “três usuários perguntaram exatamente isso na semana passada”. | Define success criteria and build evaluations — Claude API documentation |
| conjunto held-out | Um lote de casos separado desde o início, que você não olha, não roda e não toca durante o ajuste do dia a dia; é nele que você se apoia para garantir que não houve overfitting nas avaliações de “treino”. | Writing effective tools for agents — with agents — Anthropic Engineering |
| conjunto dev | O lote de casos rodado repetidamente no ajuste diário de prompts, quanto mais frequentemente melhor; as notas dele são navegação, não veredito. | Writing effective tools for agents — with agents — Anthropic Engineering |
| overfitting | Toda a configuração de prompt mais ferramentas aprendeu as características do material de avaliação em vez das regularidades da própria tarefa — como fixar uma frase no system prompt por causa de um caso que vive falhando. | Writing effective tools for agents — with agents — Anthropic Engineering |
| não é garantido | A formulação da documentação oficial para certos comportamentos ideais (como o modelo pedir espontaneamente os parâmetros obrigatórios que faltam); especialmente assim para prompts mais ambíguos e modelos menos capazes. | Tool use with Claude — Claude API documentation |
| trilha de eval | O programa executável que solda conjuntos de avaliação, correção estratificada e loops de harness: você digita um comando e as notas lhe dizem o que melhorou, o que ficou parado e se algo que estava certo quebrou. | Writing effective tools for agents — with agents — Anthropic Engineering |
| cliente stub | Um messages.create falso que devolve respostas numa ordem de fila fixa, transformando o comportamento do modelo em variável controlada e tornando a trilha inteira reprodutível. | Writing effective tools for agents — with agents — Anthropic Engineering |
| fila de respostas | A sequência de respostas pré-escrita por trás do cliente stub; a diferença entre duas versões de prompt fica fixada em duas filas, e “suponha que o prompt novo faça efeito e o modelo responda assim” está codificado como dado. | Writing effective tools for agents — with agents — Anthropic Engineering |
| isolamento entre tarefas | Uma tarefa de eval, um loop independente, um messages independente; terminou, descarta; a implementação é apenas não içar messages para fora da função. | Writing effective tools for agents — with agents — Anthropic Engineering |
| is_error | O marcador anexado ao tool_result ao devolver exceções de ferramenta: capture a exceção, embrulhe-a num resultado com esse marcador para devolver ao modelo, e incremente ao mesmo tempo o contador de erros. | Tool use with Claude — Claude API documentation |