Die Blogartikel erscheinen auf Spanisch und Katalanisch.

Ciberseguridad

apex-flash-1: un cazador de fallos con licencia MIT

Cantina Security publicó el 4 de octubre de 2026 un modelo de 321.000 millones de parámetros, afinado a partir de GLM-5.3-Flash con un solo objetivo: encontrar vulnerabilidades de software. Resuelve 40 de las 60 tareas de la prueba que midieron sus propios autores —por encima del modelo del que sale y por debajo de Claude Opus 5—, y los pesos están en Hugging Face con licencia MIT, es decir, sin pedirle permiso a nadie.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Viñeta: un perro marrón y blanco, sentado en el suelo de una habitación vacía, estira el cuello y apoya el morro contra la pared agrietada, mirando de reojo. Lleva el collar puesto, pero la correa está tirada en el suelo delante de él, con el mosquetón abierto de par en par y sin enganchar a nada.
📷 Imagen generada con IA

En resumen

  • Cantina Security y Yeta Labs publicaron el 4 de octubre de 2026 apex-flash-1, un modelo de 321.000 millones de parámetros entrenado para buscar fallos de seguridad.
  • Resuelve 40 de las 60 tareas de una prueba construida sobre 20 casos de vulnerabilidad reservados. La medición la publica quien publica el modelo, no un evaluador independiente.
  • En esa misma prueba, Claude Opus 5 High resuelve 43 de 60 y GLM-5.3-Flash, el modelo del que parte apex-flash-1, 36 de 60.
  • Se reparte con licencia MIT y los pesos están en Hugging Face. La propia ficha avisa de que está pensado para trabajar a las órdenes de un agente mayor, no por su cuenta.

Un modelo para buscar agujeros, y sin permiso de nadie

apex-flash-1 se publicó el 4 de octubre de 2026 en Hugging Face, el repositorio donde se publican modelos de IA, y lo firman Cantina Security —plataforma y empresa de seguridad de software que opera una red de investigadores de vulnerabilidades— junto a Yeta Labs, de la que la ficha del modelo solo da la cuenta pública. De Cantina, esa misma ficha no dice nada más: ni sede, ni dueño, ni tamaño.

Lo que hace noticiable la publicación no es el tamaño del modelo —321.000 millones de parámetros— ni el banco de pruebas que lo acompaña, sino para qué está entrenado. No es un asistente de programación al que se le pueda pedir, de paso, que mire si un código tiene fallos: es un modelo afinado con el objetivo explícito de encontrar vulnerabilidades en software ajeno.

Y se reparte con la licencia que menos pregunta. No hay formulario, ni revisión de uso, ni compromiso de contar a qué se dedica el modelo una vez descargado. El único freno que queda es el coste de ponerlo a funcionar.

40 de 60, y la nota la pone el propio autor

Tareas resueltas de 60, en casos de vulnerabilidad reservados
Claude Opus 5 High: 43tareas de 60 Claude Opus 5 High 43tareas de 60 apex-flash-1: 40tareas de 60 apex-flash-1 40tareas de 60 GLM-5.3-Flash (base): 36tareas de 60 GLM-5.3-Flash (base) 36tareas de 60
Ver los datos en tabla
Claude Opus 5 Highapex-flash-1GLM-5.3-Flash (base)
Tareas resueltas 43tareas de 6040tareas de 6036tareas de 60
Medición publicada por Cantina Security en la tarjeta de su propio modelo: no es una evaluación independiente. 60 tareas tomadas de 20 casos de vulnerabilidad reservados, con pass@1.

La prueba es una sola y la pasan tres modelos. Son 60 tareas tomadas de 20 casos de vulnerabilidad reservados, y apex-flash-1 resuelve 40, un 66,7 % de pass@1: mejora el resultado del modelo del que parte y se queda tres tareas por detrás de Claude Opus 5 High, que es el que más resuelve de los tres. No lo supera.

Quien ha hecho la medición es quien publica el modelo. Las tres cifras salen de la ficha de apex-flash-1, firmada por Cantina Security: no son el resultado de una evaluación independiente. Eso no las convierte en falsas, pero las deja donde están, que es en el terreno de lo que una empresa cuenta de su propio producto.

La ficha sí detalla el montaje, y el detalle ayuda a calibrar: los objetivos corrían en entornos aislados, verificadores comprobaban el estado final del objetivo y se probaron tres modos de vista —whitebox guiado y whitebox enfocado, con el código delante, y blackbox enfocado, a ciegas desde fuera—.

GLM-5.3-Flash, aprendizaje por refuerzo y el arnés de Codex

La ficha de apex-flash-1
Dato Valor
Modelo base GLM-5.3-Flash, de Z.ai
Parámetros 321.000 millones
Licencia MIT
Método Post-entrenamiento con aprendizaje por refuerzo
Resultado 40 de 60 tareas (66,7 % de pass@1)
Memoria de GPU en BF16 Unos 640 GB
Se puede servir con vLLM, SGLang, Transformers y Docker Model Runner
Dónde están los pesos Hugging Face, cantina-security/apex-flash-1
Datos de la tarjeta del modelo publicada por Cantina Security el 4 de octubre de 2026.

El punto de partida es GLM-5.3-Flash, de Z.ai, laboratorio chino de inteligencia artificial con sede en Pekín y la casa de los modelos GLM: nació en 2019 como transferencia de tecnología de la Universidad Tsinghua y cotiza en la Bolsa de Hong Kong desde el 8 de enero de 2026; entre sus accionistas se citan Meituan, Tencent, Ant Group y Xiaomi.

Sobre ese modelo, Cantina hizo un post-entrenamiento con aprendizaje por refuerzo en entornos de software y de protocolos parecidos a los de producción, y lo hizo con el arnés de agente de Codex, de OpenAI. El matiz importa: el modelo no se ha entrenado para describir vulnerabilidades en un texto, sino para buscarlas con las herramientas con las que después tendrá que trabajar.

Lo demás es logística, y es la parte que decide quién puede usarlo de verdad. Los pesos se publican en BF16 y F32, y servirlos en BF16 pide unos 640 GB de memoria de GPU: la licencia no pone ningún filtro, pero el hardware sí.

La propia ficha pone dos límites

El primero es de autonomía. La ficha no vende un investigador que trabaje solo: dice que el modelo está pensado como un trabajador especializado a las órdenes de un agente mayor. Alguien, o algo, tiene que dirigirlo y decidir dónde mira; el 66,7 % se consiguió así, no soltándolo contra internet.

El segundo es de alcance. La evaluación cubre tareas de seguridad basadas en texto, y la ficha reconoce que no se ha medido qué hace el modelo con imagen ni con vídeo. Es una advertencia de las que conviene leer al revés: lo que está medido es exactamente lo que está medido.

El contexto es lo que convierte esto en algo más que una ficha técnica. El 30 de septiembre de 2026 se documentó que las salvaguardas de GLM-5.3 fallaban. Cuatro días después, una variante de ese mismo modelo aparece afinada para buscar fallos de seguridad y publicada con la licencia más permisiva que hay.

Conclusión

La noticia no es que apex-flash-1 gane a nadie, porque no gana: en la prueba de sus propios autores se queda tres tareas de sesenta por detrás de Claude Opus 5 High. La noticia es la suma de las dos cosas —quedarse cerca y repartirse con licencia MIT—, y que de esas dos la única que no depende de la palabra de nadie es la licencia.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog