Este artículo es el primero de los muchos que estaré generando conforme vaya avanzando en mi estudio y que te propongo que me acompañes en este camino para que tu también logres ir adquiriendo el conocimiento que probablemente quieras tener.
Este contenido presenta una síntesis analítica y de estudio basada en los estándares oficiales de ISTQB® Certified Tester AI Testing (CT-AI) v2.0. El objetivo es estructurar de forma clara y precisa las diferencias, requerimientos, riesgos y dependencias que caracterizan a los sistemas basados en inteligencia artificial (IA) en comparación con el desarrollo de software convencional, además traté de buscar de qué forma se puede relacionar este tema con una determinada industria de mi interés y conocimiento, para luego procesar cierto caso de uso al plano del prompting.
Enfoque de resolución de problemas y paradigmas de diseño
La diferencia fundamental entre los sistemas convencionales y los sistemas basados en IA radica en cómo se modela la lógica para procesar los datos de entrada y generar salidas:
- Sistemas convencionales: Se desarrollan utilizando lenguajes de programación imperativos. Los programadores humanos codifican de manera explícita instrucciones lógicas paso a paso, utilizando estructuras de control de flujo como bucles (loops) y condicionales (if-then-else). Su enfoque es enteramente determinista: para una entrada dada, el sistema ejecutará la misma ruta lógica y producirá un resultado idéntico, predecible y transparente, lo que facilita entender cómo las entradas se transforman en salidas.
- Sistemas basados en IA (aprendizaje automático / ML): No siguen reglas predefinidas escritas manualmente por un desarrollador. En su lugar, el sistema analiza patrones en grandes volúmenes de datos para aprender de manera autónoma cómo responder a nuevas entradas. Utilizan razonamiento probabilístico, inferencia estadística y reconocimiento de patrones para resolver problemas. Como consecuencia, el comportamiento de estos sistemas no es puramente determinista y sus salidas pueden no ser siempre predecibles.
Alcance de la aplicación
El ámbito de viabilidad de cada tecnología determina su idoneidad según la naturaleza de la tarea:
- Sistemas convencionales: Su alcance es óptimo para tareas con especificaciones completas, estables y bien definidas, donde las reglas del negocio son conocidas y se pueden traducir fielmente a código estructurado (por ejemplo, pasarelas de pago, motores de cálculo de impuestos o sistemas de reserva de vuelos).
- Sistemas basados en IA: Su alcance se extiende a problemas altamente complejos y subjetivos que resultan impracticables de programar mediante reglas explícitas, tales como el reconocimiento de imágenes, el procesamiento de lenguaje natural (NLP), la conducción autónoma o la detección de fraudes mediante análisis de anomalías dinámicas. Además, el alcance puede abarcar tanto sistemas «bloqueados» (cuyo comportamiento queda fijo tras el despliegue) como sistemas «adaptativos» (que continúan aprendiendo y modificando su modelo en producción).
Propósito de la implementación
- Sistemas convencionales: Garantizar la precisión matemática, la consistencia operativa absoluta y la transparencia total en la ejecución de procesos estáticos de negocio.
- Sistemas basados en IA: Permitir que los sistemas de software emulen capacidades cognitivas humanas como el aprendizaje, la generalización ante datos no vistos previamente, la toma de decisiones bajo condiciones de incertidumbre y la adaptación continua al entorno operativo.
Ventajas comparativas
| Dimensión | Sistemas convencionales | Sistemas basados en IA |
|---|---|---|
| Predecibilidad | Absoluta. El comportamiento es determinista y consistente para las mismas entradas. | Probabilística. Permite manejar de forma natural la incertidumbre y la ambigüedad de los datos. |
| Transparencia | Alta. La lógica de decisión es explícita y directamente legible en el código fuente. | Variable. Los métodos tradicionales son más explicables, pero las arquitecturas complejas funcionan como «cajas negras». |
| Mantenimiento | Estático. Requiere intervención manual del programador para corregir fallos o actualizar reglas. | Autoadaptativo. Tienen la capacidad de mejorar su rendimiento de forma continua conforme asimilan nuevos datos en producción. |
| Facilidad de prueba | Alta. El oráculo de prueba (resultado esperado) es binario y verificable con técnicas estándar de QA. | Compleja. Requiere enfoques estadísticos e inferenciales debido a la naturaleza probabilística y la subjetividad de los resultados. |
Requisitos previos a considerar
La adopción de un sistema basado en IA exige condiciones previas críticas que no suelen ser tan determinantes en proyectos convencionales:
- Disponibilidad y calidad de datos: La base indispensable del aprendizaje automático es contar con conjuntos de datos de entrenamiento masivos, limpios, correctamente etiquetados y representativos del entorno real.
- Infraestructura de cómputo especializada: Los modelos de IA complejos (especialmente el aprendizaje profundo o deep learning) requieren hardware diseñado para procesamiento en paralelo masivo, como unidades de procesamiento gráfico (GPU) o procesadores neuromórficos, a diferencia de los servidores convencionales basados predominantemente en la arquitectura von Neumann clásica (CPU).
- Profesionales con habilidades multidisciplinarias: Se requiere la participación conjunta de científicos de datos, ingenieros de ML, especialistas del dominio de negocio y analistas de pruebas con conocimientos de estadística aplicable.
- Criterios de aceptación no binarios: Antes de iniciar el desarrollo, los interesados deben definir criterios de aceptación estadísticos, probabilísticos o basados en umbrales de confianza (por ejemplo, un porcentaje mínimo de precisión sobre un conjunto de validación), en lugar de la verificación puramente binaria de aprobados/fallidos de las pruebas de software convencionales.
Riesgos involucrados y desafíos críticos
- El problema de la «caja negra» (explicabilidad): Muchos modelos avanzados, como las redes neuronales profundas, contienen miles de millones de parámetros ponderados. Es sumamente difícil para un humano interpretar el porqué matemático detrás de una predicción o decisión específica, lo cual representa un riesgo legal y ético inaceptable en sectores regulados como salud, defensa, finanzas o transporte.
- Incertidumbre y no determinismo: Debido al razonamiento probabilístico, el sistema puede devolver respuestas diferentes ante entradas sutilmente modificadas. Asimismo, los modelos grandes (incluso bloqueados) pueden exhibir comportamientos no deterministas debidos a límites de precisión en operaciones de coma flotante y variaciones en la concurrencia del hardware de cómputo (como las GPUs). Esto dificulta la reproducción exacta de fallos.
- La deriva del modelo (drift) en sistemas adaptativos: En los sistemas que se actualizan de manera autónoma con datos de producción, existe el riesgo latente de que el modelo aprenda patrones erróneos o ruidosos, degradando su rendimiento progresivamente hasta desviarse de sus requisitos de diseño iniciales.
- Exposición regulatoria y penalizaciones: Con regulaciones de gran impacto como la Ley de IA de la Unión Europea (EU AI Act), los sistemas clasificados como «de alto riesgo» (por ejemplo, aquellos integrados en componentes de seguridad automotriz, aviación o dispositivos médicos) están sujetos a estrictas auditorías técnicas y controles de cumplimiento. El incumplimiento de estas normas conlleva severas sanciones económicas. En Latinoamérica y específicamente en la República Argentina, donde resido, aún hay que trabajar mucho en ello.
Dependencias con otros conceptos y prácticas para el estudio de CT-AI
Para asegurar una comprensión sólida en las siguientes unidades del syllabus, es fundamental reconocer cómo este tema inicial conecta de forma directa con los próximos contenidos:
- Modelos de calidad específicos para IA (ISO/IEC 25059): Las diferencias conceptuales fundamentales del punto 1.1.1 sustentan la necesidad de extender los modelos tradicionales de calidad (como ISO/IEC 25010) para definir características específicas para sistemas basados en IA, tales como la transparencia, la adaptabilidad funcional, la controlabilidad por el usuario y la robustez de IA.
- El flujo de trabajo de aprendizaje automático (machine learning workflow): Reemplazar código imperativo por el modelado basado en datos genera una dependencia con las etapas de comprensión de objetivos, preparación de datos, entrenamiento del modelo y validación de métricas de rendimiento del ML.
- Estrategias de prueba especializadas para mitigar la falta de predecibilidad: Dado que el oráculo de prueba ya no es binario y preciso, y que el desarrollo es de naturaleza exploratoria, el syllabus introduce técnicas diseñadas específicamente para sortear estos desafíos:
- Pruebas metamórficas (metamorphic testing): Utilizadas para resolver el problema del oráculo identificando violaciones de relaciones esperadas entre múltiples entradas y salidas consecutivas.
- Pruebas adversarias (adversarial testing): Enfocadas en evaluar la robustez del modelo frente a ligeras modificaciones de entrada intencionadas diseñadas para forzar fallos de clasificación o predicción.
- Pruebas en la sombra (shadow testing): Método para validar el rendimiento real de un modelo de IA en producción enviándole tráfico real de forma pasiva, operando de manera redundante sin afectar las decisiones críticas del sistema activo.
- Sistemas locked frente a sistemas adaptive: Esta diferenciación es la clave que define el ciclo de vida de mantenimiento y pruebas; mientras que los sistemas locked (bloqueados) permiten una estrategia de pruebas pre-despliegue equivalente a la de un sistema nuevo convencional, los sistemas adaptive (autoadaptativos) requieren infraestructuras permanentes de monitoreo dinámico y pruebas en producción para controlar el aprendizaje del modelo.
Casos de uso
A continuación presento cuatro casos de uso aplicados a la industria de la salud y en relación con ciertas áreas de mi conocimiento:
- AI en Test Management: Generación y ejecución de pruebas metamórficas para validar un software de diagnóstico por imagen. Se busca asegurar que, ante pequeñas variaciones en la entrada (ej. rotación de una radiografía), el diagnóstico del sistema se mantenga consistente, mitigando la falta de un oráculo binario.
- AI en Docencia: Sistema de tutoría inteligente para la formación de cirujanos, que analiza el progreso del estudiante en simulaciones. La IA ajusta el nivel de dificultad y el feedback en tiempo real basándose en patrones de error del alumno, modelando la incertidumbre en el aprendizaje.
- AI en Project Management: Predicción de riesgos en la implementación de infraestructura hospitalaria. La IA analiza datos históricos de proyectos similares y flujos de pacientes en tiempo real para prever cuellos de botella en la ejecución, permitiendo una asignación dinámica de recursos.
- AI en Testing de Usabilidad y Accesibilidad: Evaluación automática de portales de pacientes mediante visión computacional y procesamiento de lenguaje natural para detectar barreras de navegación para usuarios con discapacidades visuales o motoras, asegurando el cumplimiento de normativas de salud.
Evaluación del caso de uso para el prompt framework
Caso de Uso:
AI en Test Management
Al ser el dominio del estudio (ISTQB CT-AI), este caso permite aplicar directamente las estrategias de mitigación mencionadas en el documento (pruebas metamórficas, manejo de incertidumbre y riesgo de «caja negra»). El Test Management en salud, siendo un sector regulado, exige un nivel de Hardening y control superior a la docencia o al project management, haciendo que el framework sea más robusto y pedagógicamente valioso para entender la transición de la lógica determinista a la probabilística.
Prompt Framework: Gestión de pruebas en diagnóstico por imagen (IA)
Este framework está diseñado para generar casos de prueba que desafíen la robustez de un sistema de IA de diagnóstico radiológico.
1. Prompt Engineering (La Intención)
- Prompt: «Actúa como un ingeniero de calidad especializado en IA para el sector salud (ISO/IEC 25059). Genera un conjunto de datos de prueba para un modelo de clasificación de radiografías de tórax. Incluye variaciones de entrada (rotación de 5°, ruido de píxeles, cambios de contraste) y define la relación metamórfica esperada (ej. si la imagen original es ‘neumonía’, la versión alterada debe mantener la misma clasificación). Asegura que los casos de prueba cubran bordes de decisión estadísticos.»
- Inputs: Especificaciones técnicas del modelo, umbrales de confianza aceptables, y un set de datos de referencia (Gold Standard).
- Output esperado: Un archivo con casos de prueba metamórficos, incluyendo la entrada base, la transformación aplicada y la relación lógica que debe mantenerse.
2. Loop Engineering (La Iteración y Validación)
- Proceso: El output generado por el prompt no se acepta ciegamente. Se introduce un loop de validación donde los casos de prueba son ejecutados contra el sistema.
- Iteración: Si el sistema falla en una relación metamórfica, el sistema de pruebas debe clasificar el error como ‘falso positivo’ o ‘error del modelo’.
- Refinamiento: El feedback se reinyecta al prompt inicial para ajustar la generación: «El modelo falló en las rotaciones, aumenta la densidad de casos de prueba con variaciones angulares para este segmento específico».
- Cuándo ejecutar: En cada sprint de re-entrenamiento del modelo (debido a su naturaleza adaptive).
3. Hardening Engineering (La Seguridad y Cumplimiento)
- Enfoque: Dado que es un sistema médico, se aplican restricciones de «Endurecimiento» (Hardening) para evitar la «caja negra»:
- Anti-Sesgo: El prompt incluye una cláusula de verificación de diversidad demográfica en los datos de prueba.
- Auditoría (Audit Trail): Cada prueba debe generar un log que registre no solo el resultado, sino los parámetros de entrada específicos que dispararon la decisión, facilitando la explicabilidad exigida por regulaciones como el EU AI Act.
- Criterios de Parada: El sistema debe interrumpir la generación de pruebas si detecta que la incertidumbre (entropía) de la salida supera un umbral crítico.
Estado normativo: ¿Existe un «AI Act» latinoamericano o argentino vigente?
No existe una ley unificada y promulgada equivalente al EU AI Act que rija de forma general en Argentina ni en el bloque latinoamericano, por ahora.
Convivimos con un esquema atomizado y proyectos en comisión. Mientras Europa consolidó su reglamento por niveles de riesgo, la región intenta adaptar figuras preexistentes (protección de datos, derechos del consumidor y responsabilidad civil) mientras debate iniciativas legislativas que imitan el modelo europeo.
| Ámbito Territorial | Instrumento Legal / Proyecto | Enfoque Regulatorio | Estado Actual |
| Argentina | Proyecto S-0511/2025 (y exp. 6156-D-2024 / 2285-S-2024) | Clasificación por riesgos, auditorías a algoritmos y supervisión vía AAIP / ANSIA. | En debate parlamentario (Comisiones de Diputados y Senado). |
| Argentina | Ley 25.326 + Resoluciones AAIP (ej. Res. 161/2023) | Protección de datos personales, principios de transparencia algorítmica y no discriminación. | Vigente (marco base supletorio para testing). |
| Brasil | Proyecto de Ley 2338/2023 | Evaluación de impacto para sistemas de alto riesgo y derechos de personas afectadas. | En tramitación avanzada en el Senado Federal. |
| Chile | Boletín Nº 16821-19 (2024) | Inspirado en el EU AI Act: prohíbe riesgos inaceptables y fiscaliza alto riesgo. | En tramitación en el Congreso Nacional. |
Análisis del marco legal para Argentina
Si tuviera que diseñar hoy una matriz de pruebas y gobernanza en Argentina, me apoyaría en dos frentes concretos:
- El frente parlamentario (Proyectos espejo del AI Act): El Congreso argentino acumula decenas de iniciativas. Destaca el expediente S-0511/2025 (con revisiones y antecedentes en el dossier legislativo de la BCN actualizado en 2025/2026). Estos proyectos copian la estructura comunitaria europea: exigen crear un registro de sistemas, clasifican modelos en riesgo inadmisible o alto riesgo, e imponen auditorías técnicas previas al despliegue.
- El frente vigente (Regulaciones sectoriales aplicables hoy): A falta de una ley matriz, la Agencia de Acceso a la Información Pública (AAIP) marca la cancha mediante la Ley de Protección de Datos Personales (Ley 25.326) y la Resolución 161/2023 (aprobatoria del Programa de Transparencia y Protección de Datos en IA). Si tu modelo de testing procesa datos sensibles o toma decisiones automatizadas sobre usuarios locales, este es el techo normativo que ya te expone a sanciones administrativas.
Impacto directo en la estrategia de Testing de IA
Debemos comenzar a olvidarnos de las pruebas funcionales convencionales de caja negra. Cuando una regulación de alto riesgo entra en juego, la cobertura de testing se desplaza hacia cuatro frentes técnicos:
- Evaluación de datos de entrenamiento (Data Quality & Drift): Validación estricta de sets para evitar sesgos discriminatorios y fugas de privacidad.
- Explicabilidad e Interpretabilidad (XAI): Métricas tipo SHAP o LIME documentadas como evidencia auditable frente a reclamos de usuarios.
- Resiliencia y ataques adversarios: Pruebas de robustez contra inyección de prompts, envenenamiento de datos y perturbaciones en entradas críticas.
- Monitoreo de deriva (Model Drift): Automatización de pruebas de regresión continua una vez que el modelo está desplegado en producción.
Referencias normativas para trazabilidad documental
- Senado de la Nación Argentina: Proyecto de Ley sobre Sistemas de Inteligencia Artificial (Expediente S-0511/2025).
- Biblioteca del Congreso de la Nación (BCN): Dossier Legislativo de Inteligencia Artificial (Actualización parlamentaria 2025-2026).
- AAIP Argentina: Resolución 161/2023 – Lineamientos para el uso de la Inteligencia Artificial en el tratamiento de datos personales.
- Congreso Nacional de Chile: Proyecto de Ley sobre Regulación de Sistemas de Inteligencia Artificial (Boletín 16821-19).
- Senado Federal de Brasil: Projeto de Lei n° 2338/2023 (Marco Regulatório da Inteligência Artificial).
Fuente de consulta e inspiración: Syllabus ISTQB® Certified Tester AI Testing (CT-AI) v2.0, 1.1.1. Sistemas basados en IA y sistemas convencionales.
Si te interesa este tema u otros relacionados con test management, project management e inteligencia artificial generativa aplicada a estas áreas, puedes seguirme por mis canales, y contactarme por DM desde LinkedIn por cualquier consulta que tengas:
- https://www.youtube.com/c/gustavoterrera
- en LinkedIn: https://www.linkedin.com/in/gustavoterrera/
- en Instagram: https://www.instagram.com/gustavo.terrera/
