Llevo semanas viviendo con un asistente de inteligencia artificial trabajando para mí: me redacta textos, me programa scripts, me gestiona la agenda y hasta me genera los audios del podcast. Hasta ahora funcionaba sobre los planes de OpenCode, pero OpenCode ha cambiado sus condiciones y el plan ZEN sufre caídas continuas de sus modelos. Me he gastado rápido los 20 euros de saldo y me he animado a probar Qwen, la plataforma de modelos de Alibaba, de la que solo había probado ocasionalmente algún modelo. El resultado me ha convencido: he contratado su plan Lite y estoy muy contento. Además, esta semana le he hecho una auditoría de seguridad completa a todo el sistema. Os lo cuento todo.
Qwen 3.8 Max, la bestia de Alibaba
El 3 de agosto de 2026 Alibaba lanzó Qwen 3.8 Max, el modelo más grande que ha hecho hasta la fecha: 2,4 billones de parámetros en arquitectura MoE (solo activa unos 95.000 millones por token, para ser eficiente). Es multimodal de verdad: entiende texto, imágenes, vídeo y documentos. Y su ventana de contexto es de 1 millón de tokens: puedes entregarle un repositorio de código entero o cientos de páginas de documentación de una sola vez.
Lo que más me ha impresionado son sus demos oficiales:
- 16 días programando solo: construyó desde cero su propia herramienta de programación (máquina de estados, CI, bucles de tests).
- PaperBench #1: reprodujo un paper de investigación completo desde cero... y luego mejoró el método original, en un bucle de trabajo de 125 horas.
- Diseño de chips: optimizó un acelerador criptográfico en ~500 iteraciones, reduciendo su área un 81%.
- Simulación de negocio: en un e-commerce simulado durante 365 días multiplicó el capital ×4,16.
En los rankings independientes está cuarto del mundo en Arena.ai (Elo 1667, solo por detrás de Claude Opus 5 Max, Kimi K3 Max y Opus 5 High), es el segundo en visión y el segundo en código frontend. Es además el segundo modelo de pesos abiertos de la historia que consigue colarse en el top 5 mundial.
¿Y el precio? Aquí viene lo interesante: 2 $ por millón de tokens de entrada y 6 $ por millón de salida, con caché a 0,25 $. Para que os hagáis una idea: es unas 5 veces más barato que Claude Fable 5 y la mitad que Claude Opus 5 o GPT-5.6 Sol. Eso sí: los modelos de razonamiento gastan tokens "pensando", así que el coste real por tarea siempre es mayor que la tarifa plana por token.
¿Dónde gana? Tareas agénticas largas, documentos y multimodal, seguir instrucciones complejas. ¿Dónde pierde? En el código "duro" realista (ahí Fable 5 y GPT-5.6 Sol siguen por delante) y en conocimiento experto de nivel doctorado.
Qué opina la gente
He leído lo que se cuece en Hacker News, Reddit y X:
- El sentimiento general es cautelosamente positivo (Marktechpost lo mide en un 58% positivo): entusiasmo por tener otro modelo frontera de pesos abiertos, pero con fatiga de benchmarks sin verificar.
- En Hacker News hay consenso en el escepticismo sobre los benchmarks ("Qwen tiene fama de especialista en benchmarks") y una idea muy repetida: antes de usar un modelo así en producción necesitas un harness robusto alrededor. También se valora que la carrera de pesos abiertos entre laboratorios chinos nos beneficia a todos.
- En Reddit (r/LocalLLaMA) la conversación es práctica: 2,4 billones de parámetros no los carga nadie en su casa (ni a 4 bits), así que la esperanza está en que salgan versiones destiladas pequeñas.
- Las reviews independientes coinciden: "es muy bueno y muy lento; si la velocidad no importa para tu tarea, pertenece al primer nivel junto a Fable 5, GPT-5.6 Sol, Grok 4.5 y Kimi K3. La frontera está abarrotada; ahora lo que diferencia es precio, velocidad y disponibilidad".
Mi lectura: no es el modelo que destrona a los grandes cerrados, pero es la mejor relación calidad/precio de la gama alta, y que sea de pesos abiertos es una buena noticia para todos.
Mi prueba del modelo flash
Antes de nada, probé Qwen 3.7 Flash, el modelo barato y rápido de la casa (0,03 $/M de entrada). Siendo honesto: se nota que no es tan hábil como DeepSeek Flash, que es mi caballo de batalla diario. Pero también tengo que decir que ha desempeñado con éxito mis tareas habituales: resúmenes, clasificaciones, extracción de datos, respuestas rápidas. Para el 80% del trabajo diario, un modelo flash es más que suficiente; los modelos grandes hay que reservarlos para lo que de verdad lo necesita.
El resto de modelos del plan: en qué es bueno cada uno
El plan incluye una lista de modelos muy interesante. Estos son los que aparecen y para qué sirve cada uno:
- qwen3.7-plus: el generalista de la casa. Multimodal (texto + imagen), contexto de 1M de tokens. Buen equilibrio para el día a día: redacción, análisis y tareas con imágenes ocasionales.
- deepseek-v4-pro: razonamiento y código de alto nivel. Es de los mejores en programación compleja, y ahora mismo tiene promoción nocturna con 50% de descuento.
- glm-5.2 (Zhipu AI): pensado para trabajo agéntico: ejecutar tareas multi-paso, usar herramientas, trabajar en el terminal. Rápido, eficiente y con licencia MIT.
- wan2.7-image: generación de imágenes. Es el modelo visual de Alibaba para crear imágenes desde texto.
- happyhorse-1.1-i2v: anima una imagen y genera vídeo a partir de ella (image-to-video).
Además, la plataforma ofrece la familia completa Qwen (3.5/3.6/3.7 plus, los Coder para programar, Kimi K2.5, MiniMax M2.5...), cada uno con su nicho: los Coder para iteraciones rápidas de código, Kimi para contextos enormes con visión, MiniMax para código a máxima velocidad.
Un detalle importante: la cuota del plan se mide en peticiones, no en tokens. Una tarea compleja de agente puede consumir 10-30 peticiones de una vez, así que el presupuesto real se cuenta en tareas, no en mensajes.
Bonus: auditoría de seguridad de mi asistente
De nada sirve tener un asistente potente si vive en una casa con las cerraduras rotas. Así que esta semana le hice una auditoría completa. Resumen de lo que encontré y arreglé:
- Copia de seguridad primero: antes de tocar nada, backup completo de notas y memoria.
- Consolidación de credenciales: tenía 123 notas con contraseñas dispersas en mi cuaderno de notas digital. Las moví todas a una carpeta de credenciales protegida y fuera de la vista del buscador.
- Protección de datos de terceros: eliminé de las notas los datos personales de familiares y contactos que no tenían por qué estar ahí. La privacidad de los demás no es negociable.
- Limpieza de secretos sueltos: encontré contraseñas y claves apuntadas en diarios y memorias. Todas redactadas.
- Auditoría profunda del sistema: la herramienta de auditoría detectó 1 problema crítico (la interfaz de control sin verificación de dispositivo) y 6 avisos (sin límite de intentos de acceso, heurísticas multi-usuario, plugins sin fijar...).
- Endurecimiento: límite de intentos de login (10/minuto, bloqueo de 5 minutos), firewall restringido al perfil privado y a las IPs de confianza (red local y VPN), y cierre de los puertos remotos peligrosos (RDP y SMB expuestos en perfil público).
- Auditoría semanal automática: un cron ejecuta la auditoría cada lunes y me envía el resumen.
La lección más importante: el cifrado del disco protege del robo físico, no de los accesos remotos. Para eso hacen falta firewall, autenticación fuerte y límites de intentos. Si tenéis un sistema parecido en casa, hacedlo: una tarde de trabajo a cambio de dormir tranquilo.
Notas del podcast
Enlaces recomendados de este episodio:
- Anuncio oficial de Qwen 3.8 Max — el blog de Qwen con todos los benchmarks.
- Ranking mundial Arena.ai — donde Qwen 3.8 Max aparece cuarto del mundo.
- Artificial Analysis: Qwen 3.8 Max — análisis independiente de velocidad y precios.
- Reacciones en Hacker News — el debate de la comunidad técnica.
- The New Stack: reacciones a Qwen 3.8 Max — el escepticismo sobre benchmarks explicado.
- Planes y precios de Alibaba Model Studio — la documentación oficial de los planes.
- OpenClaw — la plataforma donde vive mi asistente, con su comando de auditoría
openclaw security audit --deep. - SWE-bench — la prueba estándar para medir cuánto programa de verdad un modelo.
Mis redes:
- 📲 Telegram Isla Difusión
- 🎬 Cárcel Planetaria en YouTube
- 🎙 Suscríbete a mi podcast
- Mi canal en Odysee
- En Pocket Cast
- TikTok
¿Cómo apoyar Vidas en red?
- PayPal (también directamente a juliommd@hotmail.com)
- Bizum/Revolut: revolut.me/julioqdf — tu granito de arena para el Proyecto MEGA ISLA
- Amazon: envía un cheque regalo a vidasenred@gmail.com
- Bitcoin: MW4T2qAAtaubxA7aUhAv4aozy5sQyUHQYi
Y como siempre: la tecnología es una herramienta; quien decide para qué la usas eres tú.