Agent Mentor Learn

Glosario

66 términos de «Verificación y control de calidad: que no se cuele lo que «parece correcto»». Pasa el cursor sobre la primera aparición en la lección para ver la definición.

TérminoDefiniciónFuente
parece terminadoClaude se detiene cuando el trabajo parece terminado; sin una comprobación que pueda ejecutar, «parece terminado» es la única señal que existe en todo el sistema.Best practices for Claude Code — Claude Code official documentation
bucle de verificaciónEl papel que te toca cuando no hay una comprobación ejecutable en el pipeline: cada error espera a que tú lo notes.Best practices for Claude Code — Claude Code official documentation
brecha de confiar-y-después-verificarEl nombre oficial de este fenómeno: Claude produce una implementación de apariencia plausible que no maneja los casos límite; tú confías primero, y la verificación o no ocurre o llega demasiado tarde.Best practices for Claude Code — Claude Code official documentation
afirmaciónEnunciados que solo puedes elegir creer o no: «la lógica es correcta», «debería estar bien», «ya está optimizado», «sin errores durante la ejecución».Best practices for Claude Code — Claude Code official documentation
evidenciaAlgo que una segunda persona puede volver a ejecutar exactamente igual: un comando con su salida en bruto, un código de salida, una lista de nombres de pruebas que fallaron, una captura de pantalla, una comparación numérica de antes y después.Best practices for Claude Code — Claude Code official documentation
sistema deterministaEn computación, los sistemas que producen la misma salida cada vez que reciben entradas idénticas; los verificadores de este curso son esa clase de cosa predeciblemente tonta: una cosa determinista que le pone una compuerta a una cosa no determinista.Writing effective tools for agents — with agents — Anthropic Engineering
no deterministaLos sistemas de agentes pueden generar respuestas variadas incluso con las mismas condiciones iniciales; aunque no cambies ni un carácter del prompt, no hay garantía de que las decisiones de dos ejecuciones coincidan.Writing effective tools for agents — with agents — Anthropic Engineering
errores que se componenEn los sistemas de agentes los errores hacen bola de nieve: que un paso falle lleva a los agentes a explorar trayectorias completamente distintas, y toman decisiones nuevas a partir de resultados malos, con resultados impredecibles.How we built our multi-agent research system — Anthropic Engineering
entorno de sandboxDonde Anthropic recomienda probar los agentes a fondo: la autonomía implica costos más altos y potencial de errores que se componen, así que prueba en sandboxes con los guardrails adecuados.Building Effective AI Agents — Anthropic Engineering
ground truthLa retroalimentación real que los agentes obtienen del entorno durante la ejecución —los resultados de las llamadas a herramientas o de la ejecución de código—, con la que evalúan su propio progreso. El curso conserva el término en inglés.Building Effective AI Agents — Anthropic Engineering
mejora los resultados de manera demostrableLa condición de admisión para agregar complejidad: habría que considerar agregar complejidad solo cuando mejora los resultados de manera demostrable.Building Effective AI Agents — Anthropic Engineering
stop_reasonEl campo de las respuestas del modelo que mueve el bucle de arnés: cuando su valor es tool_use, sigues ejecutando herramientas y devolviendo resultados; cuando pasa a end_turn, el bucle sale.Tool use with Claude — Claude API documentation
end_turnUno de los valores de stop_reason: significa que el modelo no piensa llamar más herramientas en este turno. Nada más.Tool use with Claude — Claude API documentation
tool_resultEl bloque de mensaje que le devuelve al modelo los resultados de ejecutar herramientas, emparejado con su tool_use vía tool_use_id; la salida del verificador vuelve a fluir a la conversación por acá.Tool use with Claude — Claude API documentation
run_checkEnvolver un script de verificación como una herramienta que el modelo puede llamar, para que ejecute la comprobación él mismo dentro del bucle y lea el resultado, con el código de salida y stdout pasados tal cual.Best practices for Claude Code — Claude Code official documentation
código de salidaCómo expresan su veredicto los scripts de verificación: 0 es aprobado, distinto de cero es fallido; CI y el && de la shell lo pueden usar directo.Best practices for Claude Code — Claude Code official documentation
aprobado/fallidoEl resultado binario objetivo que puede producir una comprobación; con él el bucle se cierra solo: Claude hace el trabajo, ejecuta la comprobación, lee el resultado e itera hasta que la comprobación pasa.Best practices for Claude Code — Claude Code official documentation
fixtureUn archivo de respuesta de referencia que guardaste de antemano; después de ejecutar, comparas la salida con él. Es lo que usa el script del menú oficial de comprobaciones que «compara la salida con un fixture». El curso conserva el término en inglés.Best practices for Claude Code — Claude Code official documentation
estado finalEl método de juicio por defecto: no juzgues si el agente siguió un proceso específico, juzga si alcanzó el estado final correcto.How we built our multi-agent research system — Anthropic Engineering
análisis turno por turnoEl enfoque que la evaluación del estado final reemplaza: revisar las acciones del agente turno por turno, intentando validar cada paso intermedio.How we built our multi-agent research system — Anthropic Engineering
punto de control de verificaciónUnas pocas posiciones de observación discretas dentro de los flujos de trabajo complejos, donde verificas que «deberían haber ocurrido cambios de estado específicos» en lugar de validar cada paso intermedio.How we built our multi-agent research system — Anthropic Engineering
punto de control de recuperaciónEl sentido del curso 9: escribir en disco el estado en ejecución del agente para que pueda retomar desde ahí después de una caída; el propósito es la recuperación, no el juicio.How we built our multi-agent research system — Anthropic Engineering
criterios de éxitoEl conjunto de requisitos que convierte «el estado final correcto» en números concretos o juicios claros; si no logras escribirlos de ninguna manera, esta tarea no debería haberse entregado por completo al agente para que la ejecute solo.Define success criteria and build evaluations — Claude API documentation
medibleEl primer requisito duro de los criterios de éxito: usa métricas cuantitativas o escalas cualitativas bien definidas; los números aportan claridad y escalabilidad.Define success criteria and build evaluations — Claude API documentation
alcanzableEl segundo requisito duro de los criterios de éxito: basa tus objetivos en referencias de la industria, experimentos previos, investigación en IA o conocimiento experto; no deberían ser irreales para las capacidades actuales de los modelos de frontera.Define success criteria and build evaluations — Claude API documentation
evaluación multidimensionalLa mayoría de los casos de uso necesitan una evaluación a lo largo de varios criterios de éxito: las dimensiones se socavan entre sí y dejan menos espacio para los atajos.Define success criteria and build evaluations — Claude API documentation
aserción de trayectoriaUn agregado opcional: para un conjunto de prompts y respuestas, puedes especificar además qué herramientas esperas que el agente llame, para medir si capta el propósito de cada herramienta.Writing effective tools for agents — with agents — Anthropic Engineering
expectedToolsEl campo opcional de los casos de evaluación que carga la aserción de trayectoria: se espera que haya tocado al menos estas herramientas, sin importar el orden ni la cantidad de llamadas.Writing effective tools for agents — with agents — Anthropic Engineering
llamadas a herramientas redundantesUna métrica de diagnóstico: cuando la cantidad de llamadas es notoriamente alta, normalmente sugiere que conviene dimensionar mejor los parámetros de paginación o de límite de tokens.Writing effective tools for agents — with agents — Anthropic Engineering
errores de herramientaUna métrica de diagnóstico: muchos errores por parámetros inválidos normalmente sugieren que a esas herramientas les vendrían bien descripciones más claras o mejores ejemplos.Writing effective tools for agents — with agents — Anthropic Engineering
calificación basada en códigoEl primer lugar del ranking de métodos de calificación: la más rápida, la más confiable y extremadamente escalable; su debilidad es que le falta matiz para los juicios complejos que necesitan menos rigidez de reglas.Define success criteria and build evaluations — Claude API documentation
calificación basada en LLMEl segundo lugar del ranking: rápida, flexible, escalable y apta para el juicio complejo; el requisito previo es probar primero que es confiable y después escalar.Define success criteria and build evaluations — Claude API documentation
calificación humanaEl tercer lugar del ranking: la más flexible y de más alta calidad, pero lenta y cara; evítala si es posible.Define success criteria and build evaluations — Claude API documentation
coincidencia exactaLa forma del borde izquierdo del espectro de verificadores: mide si la salida del modelo coincide con una respuesta correcta predefinida, normalmente después de normalizar los espacios en blanco y las mayúsculas y minúsculas.Define success criteria and build evaluations — Claude API documentation
output == golden_answerLa forma mínima de la coincidencia exacta, apenas una comprobación de igualdad; simple, sin ambigüedad, apta para las tareas con respuestas categóricas y bien delimitadas.Define success criteria and build evaluations — Claude API documentation
normalizaciónAntes de comparar, borrar las diferencias que no cargan significado: plegar los espacios consecutivos, recortar los extremos, unificar mayúsculas y minúsculas; para los montos, además lavar símbolos de moneda, separadores de miles y unidades.Define success criteria and build evaluations — Claude API documentation
verificador deterministaLa técnica central de este curso: usar código que da la misma conclusión siempre para ponerle una compuerta a la salida de un sistema no determinista, devolviendo aprobado/fallido y razones de falla legibles.Writing effective tools for agents — with agents — Anthropic Engineering
espectroLos verificadores no son unas pocas opciones mutuamente excluyentes sino una banda continua: en un extremo está la comparación exacta de cadenas con un fixture, en el otro está pedirle a Claude que juzgue.Writing effective tools for agents — with agents — Anthropic Engineering
strict: trueUna línea que agregas a las definiciones de herramientas para asegurar que las llamadas a herramientas de Claude se ajusten estrictamente al esquema que declaraste, moviendo una clase de validación de estructura aguas arriba, a una garantía a nivel de plataforma.Tool use with Claude — Claude API documentation
falso negativoEl verificador juzga como falla una salida correcta: no deja pasar errores, acusa injustamente a los que están bien.Writing effective tools for agents — with agents — Anthropic Engineering
verificador demasiado estrictoLa manera más común en que fallan las comprobaciones deterministas: por diferencias espurias como el formato, la puntuación o formulaciones alternativas válidas, juzgan como fallas respuestas correctas.Writing effective tools for agents — with agents — Anthropic Engineering
texto de forma libreSalidas como las de investigación y los resúmenes: de forma libre, rara vez con una única respuesta correcta, difíciles de evaluar por programa; los LLM encajan naturalmente para calificar esta clase de salida.How we built our multi-agent research system — Anthropic Engineering
revisión humanaUn paso que sigue siendo indispensable más allá de las pruebas automatizadas: las pruebas automatizadas verifican que la funcionalidad sea correcta, pero asegurar que las soluciones se alineen con los requisitos más amplios del sistema sigue necesitando ojos humanos.Building Effective AI Agents — Anthropic Engineering
juez LLMUsar una llamada al modelo para puntuar salidas de texto de forma libre, ubicado donde las comprobaciones deterministas no alcanzan, no como reemplazo de ellas.How we built our multi-agent research system — Anthropic Engineering
rúbricaDescomponer el vago «¿esto está bien?» en varias preguntas concretas, respondiendo y puntuando cada una por separado; para las tareas de investigación la descomposición ya hecha son cinco dimensiones.How we built our multi-agent research system — Anthropic Engineering
primero razonar y después puntuarUna técnica decisiva para los prompts de juez: hazlo escribir primero el razonamiento y después producir la puntuación, y descarta el razonamiento después; mejora el desempeño de la calificación, en especial para los juicios complejos.Define success criteria and build evaluations — Claude API documentation
contexto frescoDonde debería sentarse el revisor: solo ve la salida y los criterios que le diste, no puede ver el proceso de razonamiento que produjo ese cambio, así que juzga el resultado en sus propios términos.Best practices for Claude Code — Claude Code official documentation
autorreporteLa descripción que el agente hace de su propio proceso («recuperé tres fuentes autorizadas y las contrasté antes de confirmar el porcentaje»); por sí sola no cuenta como evidencia.Writing effective tools for agents — with agents — Anthropic Engineering
transcripción crudaEl registro de ejecución que incluye las llamadas a herramientas y sus respuestas, usado para detectar comportamientos que no están descritos explícitamente en la cadena de pensamiento del agente.Writing effective tools for agents — with agents — Anthropic Engineering
encontrar problemasEl primer modo de fallo del juez: un revisor al que se le pide encontrar huecos normalmente va a reportar algunos, incluso cuando el trabajo está sólido, porque eso es lo que le pediste.Best practices for Claude Code — Claude Code official documentation
sobreingenieríaLa consecuencia de perseguir cada hallazgo de la revisión: capas extra de abstracción, código defensivo y pruebas para casos que no pueden ocurrir.Best practices for Claude Code — Claude Code official documentation
tamaño del efectoQué tan grande es la brecha que produce un cambio: ¿es pasar de 71,2% a 72,4%, o un salto de 30% a 80%? Las brechas grandes requieren menos muestras.How we built our multi-agent research system — Anthropic Engineering
conjunto de evaluaciónUn lote de tareas emparejadas con resultados verificables; la escala oficial de arranque es de unas 20 consultas que representan el uso real; no esperes a acumular cientos.How we built our multi-agent research system — Anthropic Engineering
resultado verificableCon qué debería estar emparejado cada prompt de evaluación: un estado final juzgable, una cadena, un cambio de estado o una rúbrica; sin eso, el prompt no es una tarea de evaluación, es una demo.Writing effective tools for agents — with agents — Anthropic Engineering
caso límiteSituaciones de baja frecuencia pero que ocurren de verdad (información faltante, demandas mezcladas, errores de herramientas); son el seguro del conjunto de evaluación, no su cuerpo.Define success criteria and build evaluations — Claude API documentation
prioriza cantidad sobre calidadUn principio de diseño de conjuntos de evaluación: más preguntas con calificación automatizada de señal levemente menor es mejor que menos preguntas con evaluaciones humanas de alta calidad calificadas a mano.Define success criteria and build evaluations — Claude API documentation
distribución realA qué deberían ceñirse las evaluaciones: tus tareas de evaluación deberían estar ancladas en el uso del mundo real, al punto de poder señalar cualquier prompt y decir «tres usuarios preguntaron exactamente esto la semana pasada».Define success criteria and build evaluations — Claude API documentation
conjunto reservadoUn lote de casos apartados desde el principio, que no miras, no ejecutas y no tocas durante el ajuste del día a día; te apoyas en él para asegurarte de no sobreajustar a las evaluaciones «de entrenamiento».Writing effective tools for agents — with agents — Anthropic Engineering
conjunto de desarrolloEl lote de casos que ejecutas repetidamente cuando ajustas prompts a diario, cuanto más seguido mejor; sus puntuaciones son navegación, no veredicto.Writing effective tools for agents — with agents — Anthropic Engineering
sobreajusteQue el conjunto entero de prompt más configuración de herramientas aprenda las características del material de evaluación en vez de las regularidades de la tarea misma, como fijar en duro una oración en el prompt de sistema para un caso que falla siempre.Writing effective tools for agents — with agents — Anthropic Engineering
no está garantizadoLa formulación de la documentación oficial para ciertos comportamientos ideales (como que el modelo pida por su cuenta los parámetros requeridos que faltan); y más todavía para los prompts más ambiguos y los modelos menos capaces.Tool use with Claude — Claude API documentation
circuito de evaluaciónEl programa ejecutable que suelda conjuntos de evaluación, calificación estratificada y bucles de arnés: escribes un comando y las puntuaciones te dicen cuál mejoró, cuál no se movió y si se rompió algo que estaba bien.Writing effective tools for agents — with agents — Anthropic Engineering
cliente stubUn messages.create falso que devuelve respuestas prefijadas en el orden fijo de una cola, convirtiendo el comportamiento del modelo en una variable controlada y volviendo reproducible todo el circuito.Writing effective tools for agents — with agents — Anthropic Engineering
cola de respuestasLa secuencia de respuestas preescrita detrás del cliente stub; la diferencia entre dos versiones del prompt queda fijada por dos juegos de colas, y «supongamos que el prompt nuevo hace efecto y el modelo responde así» queda codificado como datos.Writing effective tools for agents — with agents — Anthropic Engineering
aislamiento entre tareasUna tarea de evaluación, un bucle independiente y un messages independiente; al terminar se descarta; la implementación es simplemente no sacar messages fuera de la función.Writing effective tools for agents — with agents — Anthropic Engineering
is_errorLa marca que se le adosa al tool_result cuando le devuelves al modelo una excepción de herramienta: atrapas la excepción, la envuelves en un resultado con esta marca y se la devuelves, incrementando al mismo tiempo el contador de errores.Tool use with Claude — Claude API documentation