ChatGPT, Gemini y Claude han disparado las evaluaciones sobre la desaparición de profesiones debido a la IA, y los científicos dudan de su fiabilidad

ChatGPT, Gemini y Claude han disparado las evaluaciones sobre la desaparición de profesiones debido a la IA, y los científicos dudan de su fiabilidad

38 software

Idea clave de la investigación

Los economistas de la Universidad del Noroeste y la Universidad Americana descubrieron que los tres modelos lingüísticos de IA más grandes (ChatGPT‑5, Gemini 2.5 y Claude 4.5) evalúan de manera diferente cuáles profesiones están en riesgo de automatización. Esto pone en duda la fiabilidad de los “índices de vulnerabilidad a la IA”, indicadores numéricos que utilizan políticos y empleadores para planificar el futuro del mercado laboral.

1. Cómo se llevó a cabo la investigación
Paso | Qué hicieron | Planteamiento del problema | Se pidieron a los modelos que evaluaran la vulnerabilidad de distintas profesiones frente a la IA. | Comparación de respuestas | Se compararon las evaluaciones entre sí y con datos reales. | Análisis de causas de discrepancias | Identificaron dos factores clave: diferencias en los propios modelos y el impacto de qué especialistas ya usan IA.

2. Resultados
Profesión | Claude 4.5 | Gemini 2.5 | ChatGPT‑5
Contador | Alta vulnerabilidad | Baja | Media
Gerente de publicidad | — | — | —
Director ejecutivo | — | — | —

*Discrepancias*
- Claude colocó a los contadores en la cima, Gemini mucho más abajo.
- Las evaluaciones de gerentes de publicidad y directores ejecutivos también variaron.
- ChatGPT y Gemini coincidieron en casi el 75 % de los casos, pero divergieron aproximadamente en una cuarta parte.

*Impacto de “usuarios de IA”*
Los analistas financieros trabajan activamente con redes neuronales, creando datos sobre los que se entrenan futuros modelos. Esto sesga las evaluaciones y hace que profesiones ya estrechamente vinculadas a la IA parezcan más vulnerables ante los ojos de los modelos.

3. Cómo se construyen los índices de vulnerabilidad
1. Manualmente – expertos evalúan el impacto de la IA en tareas específicas.
2. Encuestas a usuarios – recogen opiniones de quienes ya utilizan la plataforma.
3. Los mayores modelos lingüísticos (LLM) – generan evaluaciones automáticamente.

*Problemas:*
- El método manual está sujeto a subjetividad.
- Las encuestas se limitan a una sola plataforma y no reflejan todo el mercado.

Aun así, tales índices se usan ampliamente en informes analíticos, consultoría y política.

4. Qué significa esto para la práctica
- La fiabilidad de las evaluaciones sigue siendo desconocida; no está claro si los LLM dan pronósticos más precisos que los métodos expertos.
- El riesgo de basar decisiones en un solo indicador – los autores advierten que políticos y empleadores podrían depender erróneamente de cifras unívocas.

5. Recomendaciones de los investigadores
1. Usar varios modelos de IA simultáneamente, no uno solo.
2. Indicar explícitamente el nivel de incertidumbre en los resultados.
3. Confirmar las conclusiones con encuestas a usuarios reales para entender cómo se implementa realmente la IA y qué tareas realiza.

> “Personalmente no confiaría en un único indicador para decidir sobre cambiar de trabajo o elegir una especialidad”, señala Michelle Yin.

Conclusión:

Los índices actuales de vulnerabilidad a la IA necesitan un enfoque más crítico. La combinación de múltiples modelos y datos empíricos ayudará a hacer los pronósticos más fiables y evitar decisiones erróneas basadas en evaluaciones parciales.

Comentarios (0)

Comparte tu opinión — por favor, sé amable y mantente en el tema.

Aún no hay comentarios. Deja un comentario y comparte tu opinión!

Para dejar un comentario, inicia sesión.

Inicia sesión para comentar