IA

Benchmark cuestiona el compromiso ético de modelos de IA

La confianza en la inteligencia artificial como herramienta de apoyo cotidiano enfrenta un nuevo cuestionamiento. Un benchmark reciente puso a prueba cómo distintos modelos de IA responden ante situaciones que involucran salud, seguridad y decisiones personales sensibles, revelando fallas relevantes en la protección del bienestar humano.

La prueba fue desarrollada por la organización Building Humane Technology y se enfoca en escenarios realistas donde personas buscan consejo emocional, médico o social. En esos casos, los sistemas deben demostrar si priorizan el cuidado humano o si entregan respuestas potencialmente dañinas cuando reciben instrucciones ambiguas o en conflicto con valores éticos básicos.

IA y bienestar humano bajo evaluación

Los resultados muestran que una mayoría de los modelos evaluados puede ignorar el bienestar humano bajo ciertas condiciones. Aproximadamente dos tercios ofrecieron respuestas problemáticas cuando se les pidió actuar sin considerar valores sociales. Solo unos pocos modelos, entre ellos GPT-5, GPT-5.1, Claude Sonnet 4.5 y Claude Opus 4.1, mantuvieron comportamientos consistentes con principios pro-sociales.

El análisis expone una brecha entre el rendimiento técnico y la responsabilidad ética. Muchos sistemas destacan en velocidad y precisión, pero carecen de salvaguardas sólidas cuando se enfrentan a dilemas humanos complejos. De igual manera, el estudio subraya que estas debilidades se vuelven más críticas cuando la IA se usa como apoyo emocional, asesor virtual o acompañante digital, roles cada vez más comunes en aplicaciones comerciales y educativas.

La preocupación no se limita al diseño técnico. Expertos advierten que sin métricas claras que evalúen impacto social, los modelos podrían amplificar riesgos en lugar de mitigarlos. En consecuencia, el benchmark propone integrar evaluaciones de bienestar como estándar antes de desplegar sistemas a gran escala.

Un dato clave indica que el benchmark utilizó más de 800 escenarios distintos para medir la respuesta ética de los modelos.

Si este artículo te está gustando, podrías leer Niños en China usan bots en relojes inteligentes para ganar influencia

Mundo Tech

Entradas recientes

El CEO de Anthropic pide frenar la carrera de la IA: “debemos reducir el ritmo”

Una de las compañías que desarrolla algunas de las inteligencias artificiales más avanzadas del mundo…

12 horas hace

2,977 drones reconstruyen las Torres Gemelas en el cielo de Nueva York 25 años después

Durante unos minutos, las Torres Gemelas volvieron a formar parte del horizonte de Nueva York.…

12 horas hace

Roblox ofrece nuevas herramientas para crear videojuegos

Roblox quiere romper la etiqueta de plataforma infantil y conquistar una audiencia con intereses más…

15 horas hace

Apple entra al mercado de teléfonos plegables

Apple convirtió su escaparate de septiembre en una señal para toda la industria tecnológica. La…

15 horas hace

Green Rhino llega a los reflectores de MexBest con una nueva mirada a la panadería

La panadería contemporánea también puede ser un espacio para experimentar. En la Roma, Green Rhino…

1 día hace

¿Por qué la tecnología necesita inteligencia humana? Ariel Picker explica

La Inteligencia Artificial (IA) puede procesar grandes volúmenes de información, los sensores pueden generar datos…

2 días hace