para orientarte
El documento se ve terminado. Tiene títulos, cifras, recomendaciones y un tono seguro. Ese es precisamente el momento peligroso: cuando el trabajo parece suficientemente bueno como para dejar de hacer preguntas.
Verificar requiere identificar qué merece comprobación antes de que el resultado salga de tus manos.
Los modelos nuevos pueden investigar, escribir, analizar archivos, usar herramientas y completar tareas con muchos pasos. Eso cambia una parte importante de nuestra relación con la IA: necesitamos dar instrucciones claras y saber revisar el trabajo que entrega.
La respuesta corta: cuanto más trabajo delegás a una IA, más importante se vuelve definir qué significa un buen resultado antes de empezar y verificar después con criterios concretos. Fluidez, confianza y una presentación bonita no son evidencia de exactitud.
Si todavía se mezclan términos como modelo, agente, herramienta y contexto, empezá por Fundamentos de IA.
Antes era fácil revisar un párrafo
Cuando usábamos un chatbot para reescribir un correo o resumir una página, la revisión era bastante visible. Leías el resultado y decidías si servía.
Ahora un sistema puede:
- buscar información en varias fuentes;
- leer documentos;
- comparar datos;
- hacer cálculos;
- crear una recomendación;
- convertirla en una presentación;
- ejecutar acciones en otras herramientas.
En ese flujo pueden aparecer errores que no se ven a simple vista. Una fuente puede estar mal interpretada. Una fórmula puede usar una columna incorrecta. Una conclusión puede sonar razonable y depender de una suposición falsa.
Los modelos más capaces reducen algunos errores, pero no eliminan la necesidad de evaluación. OpenAI mantiene una plataforma formal de Evals precisamente para probar modelos contra criterios y datos definidos. Anthropic también documenta el patrón de generar un borrador, revisarlo contra criterios y luego refinarlo como una forma útil de separar etapas cuando necesitás inspección intermedia en sus buenas prácticas de prompting.
No necesitás una infraestructura técnica para aplicar la misma lógica en tu trabajo diario.
El cambio mental: definí bueno antes de pedirlo
Imaginá que le pedís a una IA:
“Analizá estas entrevistas y decime qué deberíamos cambiar en onboarding.”
El resultado puede sonar inteligente. Pero ¿cómo sabés si es bueno?
Antes de delegar, definí criterios como:
- cada conclusión debe citar evidencia de las entrevistas;
- patrones repetidos deben distinguirse de comentarios aislados;
- no debe inventar frecuencia cuando no existe una muestra cuantitativa;
- las recomendaciones deben conectarse con un problema observado;
- cualquier incertidumbre debe quedar explícita.
Ahora sí tenés algo contra lo cual evaluar.
Esta es una de las habilidades que incluimos en qué significa tener AI skills en 2026: producir con IA, definir calidad y revisar resultados.
Un patrón práctico: creadora, auditora, humana
Para trabajo importante podés separar tres funciones.
| Rol | Qué hace | Qué no debería hacer |
|---|---|---|
| IA creadora | produce el primer resultado | decidir si su propio trabajo es suficiente |
| IA auditora | busca errores contra criterios | asumir que la primera respuesta es correcta |
| vos | revisás evidencia y tomás la decisión | delegar responsabilidad sin entender el riesgo |
La segunda IA puede ser otra conversación del mismo modelo, otro modelo o un proceso de revisión separado.
Lo importante es la independencia del intento.
Si simplemente pegás el resultado y preguntás “¿está bien?”, el modelo conoce la conclusión y puede tender a racionalizarla. Es mejor pedir una auditoría estructurada.
Un prompt de auditoría que sí ayuda
Podés usar algo así:
Revisá este resultado como una auditora independiente. No intentes mejorarlo todavía. Identificá errores factuales, afirmaciones sin evidencia, cálculos dudosos, supuestos ocultos, contradicciones e información relevante que falte. Para cada problema indicá la evidencia y el nivel de impacto. Si no podés verificar algo, decilo explícitamente.
Después pedile una segunda salida:
Ahora proponé la corrección mínima para cada problema confirmado. Mantené separadas las correcciones de hechos, las mejoras de criterio y las preferencias de estilo.
Esa separación importa porque una frase que no te gusta no es lo mismo que un dato incorrecto.
Qué verificar según el tipo de trabajo
Research
Revisá:
- si las fuentes realmente dicen lo que el texto afirma;
- fecha y vigencia de cada fuente;
- si una opinión fue presentada como hecho;
- si faltan fuentes primarias;
- si existe evidencia que contradiga la conclusión.
Datos y hojas de cálculo
Revisá:
- columnas utilizadas;
- unidades;
- denominadores;
- filtros;
- fórmulas;
- duplicados;
- valores faltantes;
- una muestra manual de filas.
Estrategia
Revisá:
- qué supuestos sostienen la recomendación;
- qué evidencia existe;
- qué alternativas fueron descartadas;
- qué tendría que ser verdad para que la recomendación funcione;
- qué información podría cambiar la decisión.
Contenido
Revisá:
- hechos;
- citas;
- nombres;
- fechas;
- enlaces;
- claims absolutos;
- si el texto expresa realmente tu criterio y no solamente una voz plausible.
El modelo nuevo no elimina esta responsabilidad
GPT 6 Astra está diseñado para trabajo complejo de principio a fin y computer use. Claude Fable 5.1 empuja conocimiento, coding y trabajo largo. Son avances importantes.
Pero una mayor capacidad aumenta el tamaño de la tarea que podemos delegar. Eso hace que la verificación sea más importante, no menos.
Pensalo así:
capacidad mayor → delegación mayor → superficie de error mayor → mejores controles
La misma lógica aparece cuando diseñamos agentes de IA: autonomía y supervisión deben crecer juntas.
No todo necesita doble revisión
No tiene sentido convertir cada traducción o lluvia de ideas en un proceso de auditoría.
Usá el nivel de revisión según el impacto.
| Riesgo | Ejemplo | Revisión razonable |
|---|---|---|
| bajo | ideas para títulos | lectura rápida |
| medio | informe interno | criterios + muestra de evidencia |
| alto | cifras públicas o decisión importante | auditoría independiente + fuente primaria |
| muy alto | salud, legal, finanzas, seguridad | experta humana y proceso especializado |
Antes de aprobar el trabajo, preguntate:
¿qué evidencia necesito antes de confiar en este resultado específico?
Una prueba para esta semana
Elegí una tarea que ya hacés con IA y guardá tres ejemplos reales.
Para cada uno:
- escribí qué significa un resultado bueno;
- dejá que la IA haga el trabajo;
- auditá con criterios separados;
- anotá cuántas correcciones reales encontraste;
- cambiá tus instrucciones solamente si un patrón se repite.
Con cinco o diez casos empezás a construir tu propio eval, aunque nunca abras una consola técnica.
Ese hábito vale más que memorizar otro prompt viral.
Fuentes
Revisión editorial: actualizada y verificada el 6 de septiembre de 2026.
Transparencia editorial
Este artículo fue investigado y preparado con ayuda de IA. Nina revisó fuentes, contexto, criterio editorial y versión final.
