COMUNIDAD GRATIS · YA ABIERTA

El Boletínguía práctica

Criterio · verificación

Tu IA terminó el trabajo. Ahora viene la parte importante: verificarlo

Un resultado puede verse terminado y sonar seguro aunque todavía contenga errores. Revisá la evidencia antes de aprobarlo.

Cómo hicimos este artículo
En esta guía
  1. 01Antes era fácil revisar un párrafo
  2. 02El cambio mental: definí bueno antes de pedirlo
  3. 03Un patrón práctico: creadora, auditora, humana
  4. 04Un prompt de auditoría que sí ayuda
  5. 05Qué verificar según el tipo de trabajo
  6. 06El modelo nuevo no elimina esta responsabilidad
  7. 07No todo necesita doble revisión
  8. 08Una prueba para esta semana

para orientarte

El documento se ve terminado. Tiene títulos, cifras, recomendaciones y un tono seguro. Ese es precisamente el momento peligroso: cuando el trabajo parece suficientemente bueno como para dejar de hacer preguntas.

Verificar requiere identificar qué merece comprobación antes de que el resultado salga de tus manos.

Los modelos nuevos pueden investigar, escribir, analizar archivos, usar herramientas y completar tareas con muchos pasos. Eso cambia una parte importante de nuestra relación con la IA: necesitamos dar instrucciones claras y saber revisar el trabajo que entrega.

La respuesta corta: cuanto más trabajo delegás a una IA, más importante se vuelve definir qué significa un buen resultado antes de empezar y verificar después con criterios concretos. Fluidez, confianza y una presentación bonita no son evidencia de exactitud.

Si todavía se mezclan términos como modelo, agente, herramienta y contexto, empezá por Fundamentos de IA.

Antes era fácil revisar un párrafo

Cuando usábamos un chatbot para reescribir un correo o resumir una página, la revisión era bastante visible. Leías el resultado y decidías si servía.

Ahora un sistema puede:

  1. buscar información en varias fuentes;
  2. leer documentos;
  3. comparar datos;
  4. hacer cálculos;
  5. crear una recomendación;
  6. convertirla en una presentación;
  7. ejecutar acciones en otras herramientas.

En ese flujo pueden aparecer errores que no se ven a simple vista. Una fuente puede estar mal interpretada. Una fórmula puede usar una columna incorrecta. Una conclusión puede sonar razonable y depender de una suposición falsa.

Los modelos más capaces reducen algunos errores, pero no eliminan la necesidad de evaluación. OpenAI mantiene una plataforma formal de Evals precisamente para probar modelos contra criterios y datos definidos. Anthropic también documenta el patrón de generar un borrador, revisarlo contra criterios y luego refinarlo como una forma útil de separar etapas cuando necesitás inspección intermedia en sus buenas prácticas de prompting.

No necesitás una infraestructura técnica para aplicar la misma lógica en tu trabajo diario.

El cambio mental: definí bueno antes de pedirlo

Imaginá que le pedís a una IA:

“Analizá estas entrevistas y decime qué deberíamos cambiar en onboarding.”

El resultado puede sonar inteligente. Pero ¿cómo sabés si es bueno?

Antes de delegar, definí criterios como:

  • cada conclusión debe citar evidencia de las entrevistas;
  • patrones repetidos deben distinguirse de comentarios aislados;
  • no debe inventar frecuencia cuando no existe una muestra cuantitativa;
  • las recomendaciones deben conectarse con un problema observado;
  • cualquier incertidumbre debe quedar explícita.

Ahora sí tenés algo contra lo cual evaluar.

Esta es una de las habilidades que incluimos en qué significa tener AI skills en 2026: producir con IA, definir calidad y revisar resultados.

Un patrón práctico: creadora, auditora, humana

Para trabajo importante podés separar tres funciones.

RolQué haceQué no debería hacer
IA creadoraproduce el primer resultadodecidir si su propio trabajo es suficiente
IA auditorabusca errores contra criteriosasumir que la primera respuesta es correcta
vosrevisás evidencia y tomás la decisióndelegar responsabilidad sin entender el riesgo

La segunda IA puede ser otra conversación del mismo modelo, otro modelo o un proceso de revisión separado.

Lo importante es la independencia del intento.

Si simplemente pegás el resultado y preguntás “¿está bien?”, el modelo conoce la conclusión y puede tender a racionalizarla. Es mejor pedir una auditoría estructurada.

Un prompt de auditoría que sí ayuda

Podés usar algo así:

Revisá este resultado como una auditora independiente. No intentes mejorarlo todavía. Identificá errores factuales, afirmaciones sin evidencia, cálculos dudosos, supuestos ocultos, contradicciones e información relevante que falte. Para cada problema indicá la evidencia y el nivel de impacto. Si no podés verificar algo, decilo explícitamente.

Después pedile una segunda salida:

Ahora proponé la corrección mínima para cada problema confirmado. Mantené separadas las correcciones de hechos, las mejoras de criterio y las preferencias de estilo.

Esa separación importa porque una frase que no te gusta no es lo mismo que un dato incorrecto.

Qué verificar según el tipo de trabajo

Research

Revisá:

  • si las fuentes realmente dicen lo que el texto afirma;
  • fecha y vigencia de cada fuente;
  • si una opinión fue presentada como hecho;
  • si faltan fuentes primarias;
  • si existe evidencia que contradiga la conclusión.

Datos y hojas de cálculo

Revisá:

  • columnas utilizadas;
  • unidades;
  • denominadores;
  • filtros;
  • fórmulas;
  • duplicados;
  • valores faltantes;
  • una muestra manual de filas.

Estrategia

Revisá:

  • qué supuestos sostienen la recomendación;
  • qué evidencia existe;
  • qué alternativas fueron descartadas;
  • qué tendría que ser verdad para que la recomendación funcione;
  • qué información podría cambiar la decisión.

Contenido

Revisá:

  • hechos;
  • citas;
  • nombres;
  • fechas;
  • enlaces;
  • claims absolutos;
  • si el texto expresa realmente tu criterio y no solamente una voz plausible.

El modelo nuevo no elimina esta responsabilidad

GPT 6 Astra está diseñado para trabajo complejo de principio a fin y computer use. Claude Fable 5.1 empuja conocimiento, coding y trabajo largo. Son avances importantes.

Pero una mayor capacidad aumenta el tamaño de la tarea que podemos delegar. Eso hace que la verificación sea más importante, no menos.

Pensalo así:

capacidad mayor → delegación mayor → superficie de error mayor → mejores controles

La misma lógica aparece cuando diseñamos agentes de IA: autonomía y supervisión deben crecer juntas.

No todo necesita doble revisión

No tiene sentido convertir cada traducción o lluvia de ideas en un proceso de auditoría.

Usá el nivel de revisión según el impacto.

RiesgoEjemploRevisión razonable
bajoideas para títuloslectura rápida
medioinforme internocriterios + muestra de evidencia
altocifras públicas o decisión importanteauditoría independiente + fuente primaria
muy altosalud, legal, finanzas, seguridadexperta humana y proceso especializado

Antes de aprobar el trabajo, preguntate:

¿qué evidencia necesito antes de confiar en este resultado específico?

Una prueba para esta semana

Elegí una tarea que ya hacés con IA y guardá tres ejemplos reales.

Para cada uno:

  1. escribí qué significa un resultado bueno;
  2. dejá que la IA haga el trabajo;
  3. auditá con criterios separados;
  4. anotá cuántas correcciones reales encontraste;
  5. cambiá tus instrucciones solamente si un patrón se repite.

Con cinco o diez casos empezás a construir tu propio eval, aunque nunca abras una consola técnica.

Ese hábito vale más que memorizar otro prompt viral.

Fuentes

Revisión editorial: actualizada y verificada el 6 de septiembre de 2026.

Transparencia editorial

Este artículo fue investigado y preparado con ayuda de IA. Nina revisó fuentes, contexto, criterio editorial y versión final.