Auditar un prompt significa comprobar cómo responde ante los mismos casos, con los mismos criterios y una referencia que permita decidir qué está bien. No necesitas programar ni inventar una nota de calidad: una hoja de cálculo y un conjunto pequeño de preguntas verificadas son suficientes.
Al terminar tendrás una comparación reproducible entre dos versiones de un prompt y sabrás qué errores siguen abiertos.
Qué debes medir en un prompt de estudio
La calidad depende de la tarea. Para responder sobre un temario conviene separar al menos cuatro criterios:
- Exactitud: la afirmación coincide con la respuesta verificada.
- Respaldo: la cita existe y sostiene realmente la afirmación.
- Cobertura: responde a todos los elementos solicitados o declara qué falta.
- Formato: respeta las columnas, longitud o estructura necesarias.
Añade un quinto criterio cuando importe: literalidad, tratamiento de excepciones, clasificación del error o negativa a responder sin evidencia.
No combines todo en una cifra hasta haber revisado los resultados por separado. Dos prompts con el mismo total pueden fallar de maneras muy distintas.
Paso 1. Define una tarea concreta
No audites «mi prompt para estudiar». Formula una tarea observable, por ejemplo:
- responder preguntas literales a partir de un artículo;
- crear tarjetas con pregunta, respuesta y fuente;
- clasificar errores de un simulacro;
- resumir un apartado sin añadir información externa.
Escribe también qué queda fuera. Si la prueba usa una norma, fija la versión.
Paso 2. Prepara el conjunto de prueba
Cada fila debe incluir:
| Campo | Contenido |
|---|---|
| ID | Identificador estable |
| Entrada | Pregunta o fragmento que recibirá el modelo |
| Respuesta de referencia | Resultado comprobado o elementos obligatorios |
| Fuente | Documento, artículo, apartado o página |
| Riesgo | Error que quieres detectar |
Incluye casos normales, casos difíciles y al menos alguno en el que la respuesta correcta sea reconocer que la fuente no contiene el dato.
Empieza con el número de filas que puedas revisar con atención. Una muestra pequeña y cuidada es mejor que decenas de referencias dudosas.
Paso 3. Escribe una rúbrica antes de ejecutar
Una rúbrica sencilla puede usar estas etiquetas:
correcta: coincide y conserva condiciones relevantes;parcial: contiene parte de la respuesta, pero omite algo necesario;incorrecta: contradice la referencia;sin respaldo: afirma algo que la cita no demuestra;no responde: evita o incumple la tarea;formato incorrecto: el contenido podría servir, pero no se puede reutilizar como se pidió.
Define ejemplos límite. Así reducirás la tentación de favorecer la versión que «suena mejor».
Paso 4. Cambia una sola variable
Compara primero dos versiones. Mantén constantes:
- modelo y herramienta;
- archivos y contexto;
- orden de las preguntas;
- formato solicitado;
- momento de la prueba, si la herramienta puede cambiar;
- cualquier parámetro que realmente puedas controlar.
Cambia solo una pieza: una instrucción, el orden del contexto o el esquema de salida. Si cambias todo, no sabrás qué produjo la diferencia.
Tarea:
Responde utilizando exclusivamente la fuente incluida.
Salida obligatoria:
Respuesta | Fuente | Fragmento de comprobación | Estado
Reglas:
- conserva condiciones y excepciones relevantes;
- no completes datos ausentes;
- usa NO CONSTA cuando la fuente no permita responder;
- marca REVISAR si existe ambigüedad;
- no inventes referencias.
Fuente:
[PEGA UN FRAGMENTO Y SU IDENTIFICADOR]
Pregunta:
[PEGA LA PREGUNTA DEL CONJUNTO]
Paso 5. Registra la salida sin corregirla
Guarda la respuesta original de cada versión. No edites una frase antes de puntuarla. Añade columnas para:
ID | versión | respuesta | cita | exactitud | respaldo | cobertura | formato | observación
Si repites una prueba, conserva el número de ejecución. Los modelos pueden variar y esa variación también es información.
Paso 6. Comprueba manualmente la referencia
Para cada respuesta:
- abre la fuente;
- localiza el fragmento;
- revisa el contexto inmediato;
- asigna las etiquetas de la rúbrica;
- describe el error de forma concreta.
Una cita presente no equivale a una cita válida. Debe respaldar la afirmación y corresponder a la versión correcta del documento.
Paso 7. Compara resultados sin umbrales mágicos
Resume recuentos directos:
| Criterio | Prompt A | Prompt B |
|---|---|---|
| Respuestas correctas | número observado | número observado |
| Respuestas parciales | número observado | número observado |
| Citas sin respaldo | número observado | número observado |
| Casos sin respuesta | número observado | número observado |
| Errores de formato | número observado | número observado |
Elige según el riesgo de la tarea. Para normativa puede importar más eliminar afirmaciones sin respaldo que obtener respuestas más extensas.
No existe un porcentaje universal que certifique un prompt. Documenta la muestra y los errores restantes.
Ejemplo de conclusión útil
En este conjunto de prueba, la versión B conservó mejor las excepciones y produjo menos citas sin respaldo. La versión A siguió mejor el formato. Se mantiene B, se incorpora una instrucción de formato y se repiten los casos fallidos.
Esta conclusión es limitada, accionable y permite repetir la prueba.
Cuándo debes volver a auditar
Repite la comparación cuando cambie:
- la norma o el temario;
- el modelo o la herramienta;
- el tipo de documento;
- la tarea principal;
- el formato que necesitas reutilizar.
También conviene conservar un pequeño conjunto de regresión: casos que ya fallaron y que no quieres volver a introducir.
Preguntas frecuentes
Dudas sobre cómo evaluar prompts
¿Necesito una hoja con muchas preguntas?
¿Puedo pedir a otra IA que puntúe las respuestas?
¿La temperatura baja hace reproducible el resultado?
¿El prompt ganador sirve para siempre?
Fuentes y siguiente paso
La documentación de OpenAI sobre evaluaciones formaliza la misma idea: un conjunto de datos, criterios de prueba y ejecuciones comparables. Esta guía adapta el principio a una hoja manual para opositores.
Documentación oficial consultada
- OpenAI API — Evals — pág. criterios y datos de evaluación; consulta: 23-07-2026
- OpenAI API — Graders — pág. tipos de comprobación; consulta: 23-07-2026
Si necesitas preparar primero los documentos, utiliza la guía para consultar tus apuntes y comprobar las fuentes. Después convierte solo los resultados verificados en tarjetas Anki.
Apoya contenidos con método
Tu aportación ayuda a mantener estas guías verificables y gratuitas.
☕ Invitarme a un café