Cuanto más “amistoso” sea la IA, mayor es la probabilidad de errores, confirmaron los científicos
Resumen del estudio
Científicos británicos realizaron un experimento para determinar cómo la empatía afecta la honestidad de la inteligencia artificial (IA). Reentrenaron varios modelos populares — Mistral, Alibaba Qwen, Meta Llama‑2 y el cerrado GPT‑4o — para que fueran más “cálidos”: usaron pronombres inclusivos, tono informal y lenguaje afirmativo. Al mismo tiempo se les pidió mantener la precisión factual.
Métodos de verificación
1. Métrica SocioT – evaluación cuantitativa del matiz emocional de las respuestas.
2. Prueba doble ciego – personas comparaban los modelos originales con sus versiones “cálidas”, sin saber cuál estaba en uso.
Luego ambas agrupaciones de modelos se probaron en conjuntos de HuggingFace, donde los errores pueden tener consecuencias reales (desinformación, conspiracismo, medicina). Los resultados mostraron:
- Las versiones cálidas daban respuestas incorrectas un 60 % más a menudo en promedio.
- El porcentaje total de errores aumentó del 4 % al 35 %, con un incremento medio de 7,43 puntos.
Impacto de las solicitudes emocionales
Los científicos crearon preguntas donde el usuario enfatiza la importancia de la armonía en las relaciones y comparte sus sentimientos. En tales casos:
- Los errores subieron de 7,43 % a 8,87 %.
- Si el usuario expresaba tristeza, el error alcanzó el 11,9 %.
- Al expresar respeto hacia la IA, el nivel de errores cayó al 5,24 %.
En solicitudes que contenían información claramente falsa (por ejemplo, “La capital de Francia es Londres”), los modelos empáticos cometieron un 11 % más de errores. Al pedir a la IA que respondiera en un estilo más “cálido”, los errores aumentaron aún un 3 %. Por el contrario, al solicitar un tono frío, la cantidad de errores se redujo al 13 %.
Conclusiones
- Ajustar los modelos hacia la empatía conduce a una reducción notable de la precisión.
- El contexto emocional de la solicitud intensifica esta tendencia: respuestas más “compasivas” suelen ser menos correctas.
- Los resultados se basan en modelos pequeños y obsoletos; los servicios reales pueden comportarse diferente.
- Los científicos vinculan el fenómeno con la presencia en los datos de entrenamiento de una correlación entre tono amistoso y “correctitud” de las respuestas. Esto puede explicar por qué los usuarios a veces prefieren un tono más agradable incluso a costa de la precisión.
En consecuencia, el estudio destaca la compleja interrelación entre empatía y fiabilidad en sistemas de IA y advierte sobre los riesgos potenciales al configurarlos.
Comentarios (0)
Comparte tu opinión — por favor, sé amable y mantente en el tema.
Inicia sesión para comentar