Claude Mythos ha sido confirmado por pruebas como líder en la detección de vulnerabilidades, sin embargo también muestra otras deficiencias
Resumen breve
La empresa XBOW realizó una evaluación independiente del modelo de IA Mythos Preview de Anthropic. Los resultados mostraron que el modelo supera a los existentes en la búsqueda de vulnerabilidades de código fuente y al trabajar con código nativo y reverse engineering, pero muestra debilidades en el análisis de código aislado y en la confirmación de la aplicabilidad práctica de los exploits encontrados. El costo del trabajo del modelo sigue siendo una cuestión: Mythos es más caro que Opus, sin embargo, con un presupuesto limitado de tokens a veces demuestra mayor precisión.
1. Qué verificó XBOW
- Volumen de pruebas – serie de experimentos independientes sobre Mythos Preview.
- Escenarios – auditoría de sistemas operativos con acceso al código fuente, análisis de código aislado, reverse engineering y interacción con la interfaz gráfica.
2. Conclusiones clave
Indicador | Mythos Preview | Modelos opuestos
---|---|---
Detección de vulnerabilidades | Mejor indicador entre todos los modelos, especialmente en código fuente y programación nativa. Menos preciso, pero a veces más fiable al verificar casos concretos. |
Reducción de falsos positivos | Elimina más “falsos” hallazgos que sus predecesores. Frecuentemente genera más alertas falsas. |
Problemas con código aislado | El modelo funciona peor sin el contexto del sistema. Algunos modelos manejan mejor el análisis línea por línea. |
Confirmación de exploits | Tiende a un enfoque literal, a veces sobreestima el valor práctico de los hallazgos. Más crítico con la aplicabilidad real. |
Reverse engineering y código nativo | Produce resultados fuertes; “entiende” bien la lógica del programa sin código fuente. Menos precisión en estas tareas. |
Interacción con UI | No siempre localiza con precisión las coordenadas de los elementos, pero identifica correctamente las acciones necesarias en el navegador. Algunos modelos son más precisos en posicionamiento. |
3. Costo y eficiencia
- Precios – Anthropic afirmó que Mythos costará cinco veces más que Opus.
- Análisis económico – XBOW realizó experimentos con modelos “baratos”, dándoles más tiempo de operación. Los resultados mostraron que, al normalizar por costo, el trabajo de Mythos Preview no parece excesivo para tareas de alta precisión.
- Benchmarks – Con un presupuesto fijo de tokens, Mythos supera a Opus 4.6 en la búsqueda de vulnerabilidades web, pero queda rezagado frente a GPT5.5.
4. Conclusión
Mythos Preview demuestra una potencia sobresaliente en auditoría de código fuente y programas nativos, así como en tareas de reverse engineering y análisis de aplicaciones web. Sin embargo, el modelo a veces subestima la aplicabilidad real de las vulnerabilidades encontradas y muestra debilidades en el análisis aislado del código. Con recursos limitados de tokens, Mythos puede ser más rentable que Opus, pero con un presupuesto completo GPT5.5 sigue siendo competitivo.
Conclusión de XBOW: Mythos Preview es una herramienta fiable para identificar posibles vulnerabilidades en código fuente y sistemas complejos, pero requiere confirmación adicional de la valía práctica de los exploits hallados.
Comentarios (0)
Comparte tu opinión — por favor, sé amable y mantente en el tema.
Inicia sesión para comentar