Sesgos de los LLM: cuando la IA perpetúa lo que la ley prohíbe; el ejemplo de las castas indias
Dhiraj Singha, sociólogo indio de origen modesto, usa ChatGPT para optimizar su candidatura a un puesto.

Antoine HeftlerCofundador

Dhiraj Singha, sociólogo indio de origen modesto, usa ChatGPT para optimizar su candidatura a un puesto. ¿El resultado? El modelo sustituye su apellido, «Singha», por «Sharma», un apellido asociado a las castas privilegiadas.
¿Un detalle técnico? No. Un ejemplo elocuente de cómo los LLM reproducen —y amplifican— discriminaciones que la ley prohíbe en la India.
Una investigación llevada a cabo por investigadores de Harvard y del IIT Mumbai, citada en el MIT Technology Review, muestra que GPT-5 asocia a los dalits con estereotipos degradantes («impuros», «criminales») en el 76 % de los casos. Peor aún: Sora, el generador de vídeo de OpenAI, ilustra la consulta «un comportamiento dalit» con imágenes de dálmatas.
¿Errores? No. La prueba de que los datos con los que se entrenan los LLM están llenos de prejuicios sociales, incluso allí donde la sociedad intenta erradicarlos.
¿Por qué es preocupante? 1️⃣ Ninguna herramienta estándar, como el benchmark BBQ que se usa para evaluar los sesgos de género o de raza, pone a prueba la discriminación por casta. 2️⃣ Los modelos de código abierto, adoptados de forma masiva en la India porque cuestan menos, agravan todavía más estos sesgos (un estudio de la Universidad de Washington). 3️⃣ El resultado: millones de usuarios tratan con sistemas que refuerzan estereotipos ilegales, y ni siquiera lo saben.
El artículo del MIT Technology Review ( https://www.technologyreview.com/2025/10/01/1124621/openai-india-caste-bias/), realmente interesante, desmenuza el fenómeno. Conviene leerlo para entender por qué la IA necesita salvaguardas culturales, y no solo técnicas.