Durante muchos años, la disciplina del testing de software construyó su cuerpo de conocimiento sobre una premisa relativamente estable: dado un mismo input, un sistema bien diseñado debía producir un output predecible y verificable. Los sistemas basados en Inteligencia Artificial —particularmente los modelos de machine learning y los modelos generativos como los grandes modelos de lenguaje— rompen esa premisa. Su comportamiento es probabilístico, no determinista y depende críticamente de la calidad de los datos con los que fueron entrenados. Para los equipos de testing, esto no es un matiz técnico menor: es un cambio de paradigma que exige nuevas competencias.
La certificación ISTQB® Certified Tester AI Testing (CT-AI) v2.0 surge como respuesta estructurada a ese cambio. Reemplaza a la versión CT-AI v1.0 y organiza su programa de estudios en siete unidades que recorren el ciclo de vida completo de un sistema de IA, desde los fundamentos conceptuales hasta el testing del propio proceso de desarrollo de machine learning. Está pensada tanto para quienes ejecutan pruebas en el día a día —testers, analistas y líderes de test, analistas de datos y científicos de datos— como para quienes necesitan una comprensión general del fenómeno: gerentes de proyecto, responsables de calidad y directores de tecnología. El requisito previo es contar con la certificación ISTQB® Foundation Level (CTFL).
A continuación, recorreré cada una de las unidades del programa y el obstáculo concreto que habitualmente enfrentan los equipos de testing frente a proyectos de IA, junto con la manera en que las buenas prácticas propuestas por el syllabus dan respuesta a ese obstáculo.
1. Introducción a la Inteligencia Artificial
El obstáculo: equipos de testing que abordan un proyecto de IA por primera vez suelen carecer de un vocabulario y un marco conceptual compartido con los equipos de ciencia de datos. Esto genera expectativas poco realistas sobre lo que un modelo puede o no garantizar, y dificulta la comunicación entre quienes prueban y quienes entrenan el sistema.
La respuesta del CT-AI v2.0: esta unidad introduce una taxonomía común —tipos de IA, paradigmas de aprendizaje, nociones básicas de IA generativa— que permite a los testers dialogar en los mismos términos que los perfiles técnicos de datos y fijar expectativas de calidad realistas desde el inicio del proyecto.
2. Características de calidad para sistemas basados en IA
El obstáculo: los criterios de calidad tradicionales (funcionalidad, usabilidad) resultan insuficientes cuando no existe una única «respuesta correcta». Definir criterios de aceptación para un sistema probabilístico —¿Cuánta variabilidad es aceptable?, ¿Cómo se mide la equidad o la transparencia de un modelo?— es un problema que muchos equipos enfrentan sin herramientas conceptuales.
La respuesta del CT-AI v2.0: el syllabus incorpora características de calidad específicas para sistemas de IA, alineadas al estándar ISO/IEC 25059, y ofrece una guía estructurada para traducir esas características en criterios de aceptación medibles.
3. Machine Learning
El obstáculo: sin comprender cómo se entrena un modelo, qué papel juega la calidad de los datos o cómo interpretar métricas como precisión, recall o la matriz de confusión, el testing corre el riesgo de ser superficial. Las redes neuronales, además, suelen percibirse como una «caja negra» imposible de auditar.
La respuesta del CT-AI v2.0: esta unidad construye alfabetización práctica sobre los fundamentos del machine learning, los riesgos asociados a los datos (sesgos, desbalance, fuga de información) y las métricas de desempeño funcional, además de explicar el funcionamiento interno de redes neuronales simples para que el tester pueda participar activamente en la evaluación del modelo.

4. Testing de sistemas basados en IA
El obstáculo: los niveles de prueba tradicionales (unitario, integración, sistema) no siempre encajan con el pipeline de un modelo de machine learning, y testear IA generativa o modelos de lenguaje introduce desafíos nuevos, como las alucinaciones, la sensibilidad a los prompts o la ausencia de una verdad de referencia clara.
La respuesta del CT-AI v2.0: se definen niveles de prueba específicos para sistemas de machine learning y estrategias adaptadas para IA generativa y grandes modelos de lenguaje, brindando un marco ordenado para planificar las actividades de testing a lo largo de todo el ciclo de vida de la IA.
5. Testing de datos de entrada para sistemas de machine learning
El obstáculo: el principio de «basura entra, basura sale» se amplifica en machine learning. Muchos equipos omiten una revisión rigurosa de los datos de entrenamiento y recién detectan errores de etiquetado, desbalance o deriva de datos cuando el problema ya afectó a producción.
La respuesta del CT-AI v2.0: se ofrecen técnicas sistemáticas para evaluar calidad, completitud y representatividad de los datos antes de que alimenten al modelo, desplazando el control de calidad hacia etapas más tempranas del ciclo de vida.
6. Testing de modelos para sistemas de machine learning
El obstáculo: con frecuencia, la evaluación del modelo entrenado queda enteramente en manos del equipo de ciencia de datos y se reduce a una sola métrica de exactitud, dejando puntos ciegos en materia de robustez, sobreajuste o vulnerabilidad frente a entradas adversarias.
La respuesta del CT-AI v2.0: se incorporan enfoques de testing de modelos que van más allá de una métrica aislada, permitiendo que la mirada de calidad participe de forma activa —y no solo receptiva— en la validación del modelo.
7. Testing del desarrollo de machine learning
El obstáculo: los pipelines de machine learning —ingeniería de atributos, reentrenamiento, despliegue, monitoreo— cambian de forma continua, y muchos equipos no cuentan con un proceso definido para testear el propio proceso de desarrollo, lo que abre la puerta a degradaciones silenciosas del modelo en el tiempo.
La respuesta del CT-AI v2.0: el syllabus introduce técnicas para testear a lo largo de todo el ciclo de desarrollo de machine learning, sosteniendo la validación continua a medida que los modelos se reentrenan y se despliegan.
Un recurso interactivo para explorar estos siete dolores
Para acompañar este recorrido, incorporo -para tener otra visión- debajo un artefacto interactivo que resume, capítulo por capítulo, el obstáculo que enfrentan los equipos de testing y la manera en que las prácticas del CT-AI v2.0 lo mitigan, junto con una visualización cualitativa de cuatro dimensiones de impacto por unidad.
Mapa de dolores del testing de sistemas de IA
Basado en las 7 unidades del programa de estudios ISTQB® Certified Tester AI Testing (CT-AI) v2.0. Hacé clic en cada capítulo.
Para seguir profundizando
La certificación CT-AI v2.0 se sostiene sobre un programa de estudios completo, un examen de 40 preguntas con 44 puntos totales y una duración de 60 minutos (con 25% adicional para hablantes no nativos). El material oficial, incluyendo el syllabus completo y exámenes de muestra, está disponible desde la página oficial de ISTQB.
Si tu equipo está encarando —o está por encarar— un proyecto de desarrollo basado en IA, esta certificación ofrece un marco de referencia sólido para que el testing deje de ser una tarea reactiva y se convierta en un componente estructural de la confiabilidad del sistema.
Fuente de consulta e inspiración: https://istqb.org/certifications/certified-tester-ai-testing-ct-ai/
Puedes seguirme también en LinkedIn y contactarme por DM por cursos, talleres y/o algún servicio que requieras.
