Detectar palabras ofensivas ya no basta para construir sistemas digitales más confiables. Una investigación liderada desde Chile presenta una IA explicable capaz de identificar discurso de odio y mostrar qué elementos sustentan su decisión. El avance busca reducir la opacidad habitual de los modelos automatizados.
Francielle Vargas, académica de la Iniciativa de Datos e Inteligencia Artificial de la Universidad de Chile, lidera el trabajo. La investigación fue presentada en ACL 2026 y publicada en Findings of ACL 2026. Además, participaron especialistas de universidades y centros tecnológicos internacionales.
IA explicable que mira más allá de las palabras
El método recibe el nombre Supervised Moral Rationale Attention, o SMRA. Su propuesta integra fundamentos morales directamente durante el entrenamiento. Así, el modelo presta atención a fragmentos relacionados con ideas como daño, deslealtad o degradación.
Este enfoque pretende evitar decisiones basadas solamente en palabras aisladas. Asimismo, puede aportar contexto cuando una expresión cambia de significado dependiendo de factores sociales o culturales. Los investigadores desarrollaron HateBRMoralXplain, un conjunto de datos en portugués brasileño con anotaciones sobre odio y categorías morales.
¿Interesado en el tema? Mira también: Trolli Milky Wow estrena seis sabores y una textura diferente
Más transparencia para moderar contenidos digitales
Los resultados indican mejoras en detección y clasificación moral. También muestran explicaciones más fieles al razonamiento utilizado por el sistema. La equidad se mantuvo estable, sin que las mejoras introdujeran intercambios significativos relacionados con sesgos.
Por otro lado, esta IA explicable podría resultar relevante para plataformas que necesitan moderar grandes cantidades de publicaciones. Comprender las razones detrás de una clasificación facilita revisar errores y detectar asociaciones problemáticas.
El estudio todavía plantea cautela antes de trasladar SMRA a escenarios reales. En sus pruebas, la detección de discurso de odio mejoró 0.9 puntos F1 y la clasificación de sentimiento moral avanzó 1.5 puntos F1. La fidelidad de las explicaciones también aumentó 7.4 puntos porcentuales en IoU F1.











