Los investigadores de Microsoft afirman que los modelos de IA aún no son capaces de resolver tareas complejas.
Los investigadores de Microsoft descubrieron limitaciones en los modelos lingüísticos grandes (LLM) modernos al realizar tareas complejas y repetitivas
En el marco de experimentos, Microsoft Research determinó que incluso los modelos de IA más avanzados cometen errores graves cuando se les asigna ejecutar operaciones largas y multi-etapa. Entre las sistemas probados —Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4— cada uno perdió en promedio alrededor del 25 % del contenido de los documentos tras el procesamiento autónomo.
Qué se evaluó exactamente
* Benchmark DELEGATE‑52
Creado por el equipo de Felipe Labán, Tobias Schnabel y Jennifer Nevill. Simula flujos de trabajo en 52 dominios profesionales: desde programación y notación musical hasta cristalografía.
* Criterio de evaluación
Los modelos se evaluaron según cuán bien conservan la integridad del documento después de 20 ciclos de procesamiento. El umbral de “listo” se fijó al 98 %; si el resultado caía por debajo, la tarea se consideraba fallida.
Conclusiones principales
Área | Mejores resultados | Programación | Los mejores indicadores | Lenguaje natural | Modelos menos fiables
---|---|---|---|---|---
* Caída de calidad
En más del 80 % de las combinaciones de documentos, la calidad cayó al 80 % o menos. El mejor modelo (Gemini 3.1 Pro) cumplía los criterios de lista solo en 11 de 52 áreas.
* Errores saltarines
Las pérdidas no ocurrían gradualmente, sino “en saltos”: en un ciclo de interacción el modelo podía perder entre el 10 % y el 30 % de precisión. Los modelos más avanzados (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) intentaban evitar errores menores, posponiendo su manejo a etapas posteriores y reduciendo la cantidad de interacciones.
* Gestión por agente
Al usar herramientas en modo gestión por agente, los resultados no mejoraron: al final del ciclo la calidad caía aproximadamente un 6 %.
Qué significa esto para los usuarios
Los científicos subrayan que los usuarios todavía deben controlar cuidadosamente el trabajo de las sistemas IA cuando les delegan autoridad. Los modelos actuales solo pueden operar de forma autónoma en dominios estrechos.
Sin embargo, los autores del benchmark señalan un progreso notable: la familia de modelos OpenAI mejoró su rendimiento del 14,7 % al 71,5 % en 16 meses. Esto confirma que los LLM siguen evolucionando, pero aún están limitados en tareas complejas y repetitivas.
Comentarios (0)
Comparte tu opinión — por favor, sé amable y mantente en el tema.
Inicia sesión para comentar