Mostrando entradas con la etiqueta Qwen. Mostrar todas las entradas
Mostrando entradas con la etiqueta Qwen. Mostrar todas las entradas

20/8/26

Qwen 3.8 Max: he probado la bestia de 2,4 billones de parámetros de Alibaba (y de paso he auditado la seguridad de mi asistente de IA)

Llevo semanas viviendo con un asistente de inteligencia artificial trabajando para mí: me redacta textos, me programa scripts, me gestiona la agenda y hasta me genera los audios del podcast. Hasta ahora funcionaba sobre los planes de OpenCode, pero OpenCode ha cambiado sus condiciones y el plan ZEN sufre caídas continuas de sus modelos. Me he gastado rápido los 20 euros de saldo y me he animado a probar Qwen, la plataforma de modelos de Alibaba, de la que solo había probado ocasionalmente algún modelo. El resultado me ha convencido: he contratado su plan Lite y estoy muy contento. Además, esta semana le he hecho una auditoría de seguridad completa a todo el sistema. Os lo cuento todo.

Qwen 3.8 Max, la bestia de Alibaba

El 3 de agosto de 2026 Alibaba lanzó Qwen 3.8 Max, el modelo más grande que ha hecho hasta la fecha: 2,4 billones de parámetros en arquitectura MoE (solo activa unos 95.000 millones por token, para ser eficiente). Es multimodal de verdad: entiende texto, imágenes, vídeo y documentos. Y su ventana de contexto es de 1 millón de tokens: puedes entregarle un repositorio de código entero o cientos de páginas de documentación de una sola vez.

Lo que más me ha impresionado son sus demos oficiales:

  • 16 días programando solo: construyó desde cero su propia herramienta de programación (máquina de estados, CI, bucles de tests).
  • PaperBench #1: reprodujo un paper de investigación completo desde cero... y luego mejoró el método original, en un bucle de trabajo de 125 horas.
  • Diseño de chips: optimizó un acelerador criptográfico en ~500 iteraciones, reduciendo su área un 81%.
  • Simulación de negocio: en un e-commerce simulado durante 365 días multiplicó el capital ×4,16.

En los rankings independientes está cuarto del mundo en Arena.ai (Elo 1667, solo por detrás de Claude Opus 5 Max, Kimi K3 Max y Opus 5 High), es el segundo en visión y el segundo en código frontend. Es además el segundo modelo de pesos abiertos de la historia que consigue colarse en el top 5 mundial.

¿Y el precio? Aquí viene lo interesante: 2 $ por millón de tokens de entrada y 6 $ por millón de salida, con caché a 0,25 $. Para que os hagáis una idea: es unas 5 veces más barato que Claude Fable 5 y la mitad que Claude Opus 5 o GPT-5.6 Sol. Eso sí: los modelos de razonamiento gastan tokens "pensando", así que el coste real por tarea siempre es mayor que la tarifa plana por token.

¿Dónde gana? Tareas agénticas largas, documentos y multimodal, seguir instrucciones complejas. ¿Dónde pierde? En el código "duro" realista (ahí Fable 5 y GPT-5.6 Sol siguen por delante) y en conocimiento experto de nivel doctorado.

Qué opina la gente

He leído lo que se cuece en Hacker News, Reddit y X:

  • El sentimiento general es cautelosamente positivo (Marktechpost lo mide en un 58% positivo): entusiasmo por tener otro modelo frontera de pesos abiertos, pero con fatiga de benchmarks sin verificar.
  • En Hacker News hay consenso en el escepticismo sobre los benchmarks ("Qwen tiene fama de especialista en benchmarks") y una idea muy repetida: antes de usar un modelo así en producción necesitas un harness robusto alrededor. También se valora que la carrera de pesos abiertos entre laboratorios chinos nos beneficia a todos.
  • En Reddit (r/LocalLLaMA) la conversación es práctica: 2,4 billones de parámetros no los carga nadie en su casa (ni a 4 bits), así que la esperanza está en que salgan versiones destiladas pequeñas.
  • Las reviews independientes coinciden: "es muy bueno y muy lento; si la velocidad no importa para tu tarea, pertenece al primer nivel junto a Fable 5, GPT-5.6 Sol, Grok 4.5 y Kimi K3. La frontera está abarrotada; ahora lo que diferencia es precio, velocidad y disponibilidad".

Mi lectura: no es el modelo que destrona a los grandes cerrados, pero es la mejor relación calidad/precio de la gama alta, y que sea de pesos abiertos es una buena noticia para todos.

Mi prueba del modelo flash

Antes de nada, probé Qwen 3.7 Flash, el modelo barato y rápido de la casa (0,03 $/M de entrada). Siendo honesto: se nota que no es tan hábil como DeepSeek Flash, que es mi caballo de batalla diario. Pero también tengo que decir que ha desempeñado con éxito mis tareas habituales: resúmenes, clasificaciones, extracción de datos, respuestas rápidas. Para el 80% del trabajo diario, un modelo flash es más que suficiente; los modelos grandes hay que reservarlos para lo que de verdad lo necesita.

El resto de modelos del plan: en qué es bueno cada uno

El plan incluye una lista de modelos muy interesante. Estos son los que aparecen y para qué sirve cada uno:

  • qwen3.7-plus: el generalista de la casa. Multimodal (texto + imagen), contexto de 1M de tokens. Buen equilibrio para el día a día: redacción, análisis y tareas con imágenes ocasionales.
  • deepseek-v4-pro: razonamiento y código de alto nivel. Es de los mejores en programación compleja, y ahora mismo tiene promoción nocturna con 50% de descuento.
  • glm-5.2 (Zhipu AI): pensado para trabajo agéntico: ejecutar tareas multi-paso, usar herramientas, trabajar en el terminal. Rápido, eficiente y con licencia MIT.
  • wan2.7-image: generación de imágenes. Es el modelo visual de Alibaba para crear imágenes desde texto.
  • happyhorse-1.1-i2v: anima una imagen y genera vídeo a partir de ella (image-to-video).

Además, la plataforma ofrece la familia completa Qwen (3.5/3.6/3.7 plus, los Coder para programar, Kimi K2.5, MiniMax M2.5...), cada uno con su nicho: los Coder para iteraciones rápidas de código, Kimi para contextos enormes con visión, MiniMax para código a máxima velocidad.

Un detalle importante: la cuota del plan se mide en peticiones, no en tokens. Una tarea compleja de agente puede consumir 10-30 peticiones de una vez, así que el presupuesto real se cuenta en tareas, no en mensajes.

Bonus: auditoría de seguridad de mi asistente

De nada sirve tener un asistente potente si vive en una casa con las cerraduras rotas. Así que esta semana le hice una auditoría completa. Resumen de lo que encontré y arreglé:

  1. Copia de seguridad primero: antes de tocar nada, backup completo de notas y memoria.
  2. Consolidación de credenciales: tenía 123 notas con contraseñas dispersas en mi cuaderno de notas digital. Las moví todas a una carpeta de credenciales protegida y fuera de la vista del buscador.
  3. Protección de datos de terceros: eliminé de las notas los datos personales de familiares y contactos que no tenían por qué estar ahí. La privacidad de los demás no es negociable.
  4. Limpieza de secretos sueltos: encontré contraseñas y claves apuntadas en diarios y memorias. Todas redactadas.
  5. Auditoría profunda del sistema: la herramienta de auditoría detectó 1 problema crítico (la interfaz de control sin verificación de dispositivo) y 6 avisos (sin límite de intentos de acceso, heurísticas multi-usuario, plugins sin fijar...).
  6. Endurecimiento: límite de intentos de login (10/minuto, bloqueo de 5 minutos), firewall restringido al perfil privado y a las IPs de confianza (red local y VPN), y cierre de los puertos remotos peligrosos (RDP y SMB expuestos en perfil público).
  7. Auditoría semanal automática: un cron ejecuta la auditoría cada lunes y me envía el resumen.

La lección más importante: el cifrado del disco protege del robo físico, no de los accesos remotos. Para eso hacen falta firewall, autenticación fuerte y límites de intentos. Si tenéis un sistema parecido en casa, hacedlo: una tarde de trabajo a cambio de dormir tranquilo.

Notas del podcast

Enlaces recomendados de este episodio:

Mis redes:

¿Cómo apoyar Vidas en red?

  • PayPal (también directamente a juliommd@hotmail.com)
  • Bizum/Revolut: revolut.me/julioqdf — tu granito de arena para el Proyecto MEGA ISLA
  • Amazon: envía un cheque regalo a vidasenred@gmail.com
  • Bitcoin: MW4T2qAAtaubxA7aUhAv4aozy5sQyUHQYi

Y como siempre: la tecnología es una herramienta; quien decide para qué la usas eres tú.

31/7/26

¿Qwen 3.7 plus o max? Comparativa de precios y uso real con OpenClaw

Llevo meses usando OpenClaw como asistente personal, con DeepSeek como proveedor principal. Pero hace poco me planteé una pregunta: ¿y si quiero usar modelos de Qwen? ¿Me conviene más Qwen 3.7 Plus o Qwen 3.7 Max?

La respuesta no es obvia. Depende de cuántos tokens consumo, qué tipo de tareas hago, si automatizo, y cuánto estoy dispuesto a pagar. Así que hice los números. Este post es el resultado.


0. ¿Qué es OpenCode Go?

OpenCode Go es un plan de suscripción de opencode.ai que ofrece acceso a múltiples modelos de IA por un precio fijo mensual. Es el plan más barato del mercado para acceso multi-modelo: 10 USD al mes (5 USD el primer mes).

Lo interesante de OpenCode Go no es solo el precio, sino qué incluye:

  • Acceso a 16+ modelos: Qwen 3.7 Max, Qwen 3.7 Plus, DeepSeek V4 Pro, DeepSeek V4 Flash, Kimi K3, GLM-5.2, Grok 4.5, MiniMax M3, MiMo-V2.5, Hy3, y más.
  • API compatible con OpenAI: funciona con OpenClaw, OpenCode, Claude Code, Cursor, y cualquier agente que hable el protocolo OpenAI.
  • Sin restricciones de automatización: puedes usarlo para scripts, agentes autónomos, crones, heartbeats, lo que quieras.
  • Límites por requests, no por tokens: cada modelo tiene un número máximo de requests por 5 horas, por semana y por mes.

La clave está en que no todos los modelos tienen los mismos límites. Algunos son muy generosos (DeepSeek V4 Flash: 31.650 requests/5h), otros son restrictivos (Qwen 3.7 Max: solo 950 requests/5h).

¿Y cuánto cuesta usar Qwen 3.7 Plus vs Max dentro de OpenCode Go? Vamos a los números.


1. Mi caso de uso: qué hago con OpenClaw

Antes de comparar modelos, necesito explicar cómo uso yo OpenClaw, porque los números de consumo varían mucho según el patrón de uso.

Uso OpenClaw a diario, con DeepSeek V4 Flash como modelo principal (97% del tiempo), y ocasionalmente DeepSeek V4 Pro (3%) para tareas más complejas. Estos son mis números reales de los últimos 30 días (junio-julio 2026):

  • Coste total: 5,37 USD/mes
  • Requests: ~260 al día / ~7.800 al mes
  • Tokens de entrada: 443 millones al mes
  • Tokens de salida: ~3 millones al mes
  • Cache hits: 95% de los tokens de entrada (DeepSeek los cobra a 0,0028 USD/1M, prácticamente regalados)

¿Qué tipo de tareas hago?

Mi uso de OpenClaw no es solo coding. Es un asistente personal con automatizaciones:

  • Boletín de noticias IA diario (7:15 AM): genera guion desde NewsAPI, locuta con Azure TTS, publica en Spreaker y redes. ~16.000 tokens de salida por boletín.
  • Eventos del día (8:00 AM): consulta Google Calendar y me avisa por Telegram. ~500 tokens por ejecución.
  • Revisión de Gmail: busca nóminas, facturas. ~2.000 tokens por búsqueda.
  • Heartbeats periódicos: cada 30 min, revisa correo, calendario, tareas. ~1.000 tokens por heartbeat.
  • Chat conversacional: respuestas a preguntas, análisis de documentos, redacción de correos. ~500-2.000 tokens por respuesta.
  • Automatizaciones varias: actualización de Notion (gastos, peso, facturas), Google Sheets (donaciones), generación de audio con Azure TTS, publicación en redes.

En total, son entre 5 y 8 tareas automatizadas al día, más heartbeats cada 30 min, más chat conversacional. Todo esto con DeepSeek V4 Flash, que es barato gracias a los cache hits.

¿Cambiaría el patrón de uso con Qwen 3.7? No fundamentally. Las mismas tareas, pero con otro modelo. La pregunta es: ¿cuánto me costaría?


2. Qwen 3.7 Plus vs Max: diferencias, precios y habilidades

Qwen 3.7 es la familia de modelos de Alibaba Cloud. Hay dos versiones principales disponibles vía API: Plus y Max. No son solo "versiones pequeña y grande del mismo modelo". Son arquitecturas diferentes con casos de uso diferentes.

Qwen 3.7 Plus

  • Tipo: modelo multimodal (texto + imagen + vídeo)
  • Contexto: hasta 1 millón de tokens
  • Habilidades clave:
    • Percepción de escenas reales, lectura de pantallas, interacción con GUIs
    • Generación de código desde imágenes o descripciones
    • Agente híbrido interactivo multi-modal
    • Soporta preserve_thinking para razonamiento extendido
  • Precio (API directa o OpenCode Go):
    • ≤256K tokens: 0,40 USD input / 1,60 USD output por 1M tokens
    • >256K tokens: 1,20 USD input / 4,80 USD output por 1M tokens
  • Límites en OpenCode Go: 4.300 requests/5h, ~21.600 requests/mes

Qwen 3.7 Max

  • Tipo: modelo flagship, reasoning-native, cerrado (no open-weight)
  • Contexto: 1 millón de tokens
  • Habilidades clave:
    • Modo nativo de pensamiento extendido (extended thinking)
    • Compatible con protocolo Anthropic Messages (drop-in para Claude Code)
    • Ejecución autónoma sostenida: puede trabajar en tareas de 35+ horas sin intervención
    • Frontier coding agent: diseño frontend, razonamiento complejo, coding largo
    • Benchmarks: 88.4 GPQA Diamond, 91.3 AIME 2026, 83.6 LiveCodeBench v6
  • Precio (API directa o OpenCode Go): 2,50 USD input / 7,50 USD output por 1M tokens
  • Límites en OpenCode Go: 950 requests/5h, ~4.770 requests/mes

Comparación directa

Aspecto Qwen 3.7 Plus Qwen 3.7 Max
Precio input (1M tokens) 0,40 USD 2,50 USD
Precio output (1M tokens) 1,60 USD 7,50 USD
Requests/mes (OpenCode Go) ~21.600 ~4.770
Contexto 1M tokens 1M tokens
Multi-modal (imagen/vídeo) ✅ Sí ❌ No (solo texto)
Extended thinking nativo ✅ Sí (preserve_thinking) ✅ Sí (nativo)
Agente autónomo largo (35h+) ❌ No ✅ Sí
Frontier coding agent ✅ Bueno ✅ Excelente
Open-weight ❌ No ❌ No

En resumen: Max es ~6x más caro en input y ~4.7x más caro en output. Pero Max es el modelo flagship para tareas de razonamiento complejo, coding autónomo largo, y diseño frontend. Plus es más barato, multi-modal, y tiene más requests disponibles.


3. ¿Cómo funcionaría cada uno con OpenClaw a nivel agéntico?

OpenClaw es un agente que puede usar herramientas, automatizar tareas, y mantener conversaciones multi-turno. La pregunta es: ¿cómo se comporta Qwen 3.7 Plus vs Max dentro de OpenClaw?

Qwen 3.7 Plus en OpenClaw

Casos de uso ideales:

  • Chat conversacional: respuestas rápidas, análisis de documentos, redacción de correos. Plus es suficiente y barato.
  • Tareas multi-modales: si necesitas que el agente analice imágenes (capturas de pantalla, fotos de documentos, gráficos), Plus es la única opción (Max no soporta imagen).
  • Automatizaciones rutinarias: heartbeats, revisión de correo, actualización de bases de datos. Plus tiene 21.600 requests/mes, suficiente para ~720 requests/día.
  • Generación de guiones: para boletines de noticias, podcasts, vídeos. Plus genera texto de calidad a bajo coste.

Limitaciones:

  • No puede sostener tareas autónomas de 35+ horas sin intervención.
  • Para razonamiento matemático/científico muy complejo, puede quedarse corto.
  • Frontend design es bueno, pero no al nivel de Max.

Qwen 3.7 Max en OpenClaw

Casos de uso ideales:

  • Coding agent autónomo: si necesitas que OpenClaw refactorice un código grande, haga migraciones complejas, o trabaje en un proyecto de múltiples archivos durante horas, Max es la opción.
  • Razonamiento complejo: análisis teológico profundo, matemáticas avanzadas, lógica compleja. Max tiene extended thinking nativo y benchmarks superiores.
  • Diseño frontend: si OpenClaw genera interfaces web, Max produce código más limpio y estético.
  • Tareas de larga duración: Max puede trabajar de forma autónoma durante 35+ horas en tareas de largo horizonte.

Limitaciones:

  • Solo 4.770 requests/mes en OpenCode Go. Eso son ~160 requests/día. Si haces heartbeats cada 30 min (48/día) + 10-20 tareas automáticas/día + chat conversacional, te quedas sin requests rápido.
  • No soporta imagen/vídeo. Si necesitas análisis visual, tienes que usar Plus u otro modelo.
  • 6x más caro si usas la API directa.

Mi evaluación para mi caso de uso

Para mi patrón de uso (260 requests/día, 95% tareas rutinarias, 5% tareas complejas):

  • Qwen 3.7 Plus: cubriría el 95% de mis tareas. Los 21.600 requests/mes son suficientes para mis 7.800 requests/mes actuales. Y el precio es 6x menor.
  • Qwen 3.7 Max: solo lo usaría para el 5% de tareas complejas (análisis teológico, razonamiento matemático, coding autónomo largo). Pero con solo 4.770 requests/mes, tendría que ser muy selectivo.

Conclusión: para uso diario como asistente personal con automatizaciones, Plus es más práctico. Max es overkill para el 95% de las tareas, y te quedas sin requests rápido.


4. Costes reales: OpenCode Go vs API directa vs Qwen Token Plan

Ahora la pregunta del millón: ¿cuánto me costaría usar Qwen 3.7 con mi patrón de uso actual?

Voy a calcularlo para tres escenarios:

  1. OpenCode Go (suscripción de 10 USD/mes, límites por requests)
  2. API directa de Qwen (pay-as-you-go, pago por tokens)
  3. Qwen Token Plan (suscripción con créditos, pero con restricciones)

Escenario 1: OpenCode Go

OpenCode Go cuesta 10 USD/mes y te da límites por requests, no por tokens. Los límites son:

  • Qwen 3.7 Plus: 4.300 requests/5h, ~21.600 requests/mes
  • Qwen 3.7 Max: 950 requests/5h, ~4.770 requests/mes

Mi uso actual: ~260 requests/día, ~7.800 requests/mes.

¿Entra en Plus? Sí. 7.800 requests/mes está muy por debajo de los 21.600 requests/mes de Plus. Podría hacer todas mis tareas con Plus sin tocar el límite.

¿Entra en Max? No. 7.800 requests/mes supera los 4.770 requests/mes de Max. Tendría que reducir mi uso a ~160 requests/día, lo cual es inviable para mi patrón actual.

Coste con OpenCode Go:

  • Plus: 10 USD/mes (el plan completo, que incluye acceso a todos los modelos)
  • Max: no viable con mi uso actual (me quedaría sin requests a mitad de mes)

Escenario 2: API directa de Qwen (pay-as-you-go)

Si uso la API directa de Qwen (vía DashScope o Alibaba Cloud Model Studio), pago por tokens consumidos. Los precios son los mismos que en OpenCode Go, pero sin límites de requests.

Cálculo con mi uso actual:

  • Tokens de entrada: 443M/mes (pero el 95% son cache hits, que se cobran a 0,0028 USD/1M en DeepSeek, no en Qwen)
  • Tokens de salida: 3M/mes

Problema: Qwen no tiene cache hits como DeepSeek. En Qwen, todos los tokens de entrada se cobran al precio normal (0,40 USD/1M para Plus, 2,50 USD/1M para Max).

Coste con Qwen 3.7 Plus (API directa):

  • Input: 443M tokens × 0,40 USD/1M = 177,20 USD/mes
  • Output: 3M tokens × 1,60 USD/1M = 4,80 USD/mes
  • Total: 182 USD/mes

Coste con Qwen 3.7 Max (API directa):

  • Input: 443M tokens × 2,50 USD/1M = 1.107,50 USD/mes
  • Output: 3M tokens × 7,50 USD/1M = 22,50 USD/mes
  • Total: 1.130 USD/mes

¡Ouch! La API directa de Qwen es 34x más cara que DeepSeek para Plus, y 210x más cara para Max. ¿Por qué? Porque DeepSeek tiene cache hits que reducen el coste de input a 0,0028 USD/1M, mientras que Qwen cobra 0,40 USD/1M (Plus) o 2,50 USD/1M (Max) por todos los tokens de entrada.

Conclusión: la API directa de Qwen es inviable para mi patrón de uso. Solo tiene sentido si consumes muchos menos tokens (por ejemplo, si no tienes heartbeats cada 30 min, o si usas contextos mucho más cortos).

Escenario 3: Qwen Token Plan

Qwen ofrece un Token Plan con tres niveles:

Plan Precio Créditos/7 días Créditos/5 horas
Lite ~6 USD/mes 2.500 700
Standard ~18 USD/mes 10.000 3.000
Pro ~68 USD/mes 40.000 12.000

Los créditos se consumen según el modelo y los tokens. Según el ejemplo oficial de Qwen, una llamada de ~50.000 tokens a qwen3.6-plus consume ~3,18 créditos. Aplicando esa proporción a mi uso:

  • Consumo diario estimado: ~554 créditos
  • Consumo semanal: ~3.878 créditos

¿Qué plan necesito?

  • Lite (6 USD): 2.500 créditos/semana. No alcanza (necesito 3.878).
  • Standard (18 USD): 10.000 créditos/semana. Sí alcanza, con margen.
  • Pro (68 USD): 40.000 créditos/semana. Sobra, pero es caro.

Coste con Qwen Token Plan:

  • Standard: ~18 USD/mes

Pero hay un problema grave: los términos de uso del Token Plan prohíben la automatización:

"No API automation: Use is limited to interactive use within programming and agent tools. Using the API Key for automated scripts, application backends, or non-interactive batch processing is prohibited."

Esto significa que no puedo usar el Token Plan para mis automatizaciones (boletín diario, heartbeats, revisión de correo, etc.). Solo puedo usarlo para chat interactivo. Para mí, eso lo hace inviable.

Resumen de costes

Opción Coste mensual ¿Viable para mi uso? ¿Automatización?
DeepSeek (actual) 5,37 USD ✅ Sí ✅ Sí
OpenCode Go (Plus) 10 USD ✅ Sí (21.600 req/mes) ✅ Sí
OpenCode Go (Max) 10 USD ❌ No (solo 4.770 req/mes) ✅ Sí
API directa Qwen (Plus) 182 USD ✅ Sí (sin límites) ✅ Sí
API directa Qwen (Max) 1.130 USD ✅ Sí (sin límites) ✅ Sí
Qwen Token Plan (Standard) ~18 USD ✅ Sí (10.000 créditos/sem) ❌ Prohibida

Ganador claro: DeepSeek a 5,37 USD/mes, gracias a los cache hits. OpenCode Go a 10 USD/mes es la segunda opción más barata, y me da acceso a Qwen 3.7 Plus si quiero probarlo.


5. ¿Y Ollama Cloud? Estimación de costes

Ollama Cloud es el servicio de inferencia gestionada de Ollama. No cobra por tokens, sino por tiempo de GPU. Los planes son:

Plan Precio Uso cloud Modelos concurrentes
Free 0 USD Ligero (experimentar) 1
Pro 20 USD/mes 50× Free 3
Max 100 USD/mes 250× Free 10

Ollama Cloud no tiene Claude (Anthropic no permite que sus modelos se usen en plataformas de terceros). Pero tiene modelos open como:

  • DeepSeek V4 Flash (el mismo que uso ahora)
  • DeepSeek V4 Pro
  • Nemotron 3 Ultra (NVIDIA)
  • Qwen 3.5, 3.6, 3.7 (familia completa)
  • Kimi K2.6, K2.7, K3
  • GLM-5.1, GLM-5.2
  • GPT-OSS (open-weight de OpenAI)
  • Gemma 4 (Google)
  • Mistral Large 3
  • Y más

¿Me conviene Ollama Cloud para mi uso?

El plan que necesitaría es el Pro (20 USD/mes), porque el Free es solo para experimentar.

Ventajas:

  • Facturación fija: 20 USD/mes, sin sorpresas.
  • Sin restricciones de automatización: puedes usarlo para scripts, agentes, crones, heartbeats.
  • Acceso a 40+ modelos: no solo Qwen, también DeepSeek, Kimi, GLM, Gemma, Mistral, etc.
  • 3 modelos concurrentes: puedo tener OpenClaw usando un modelo mientras otra herramienta usa otro.
  • Privacidad: "Prompt or response data is never logged or trained on."

Desventajas:

  • 20 USD/mes vs 5,37 USD/mes de DeepSeek: son 15 USD más al mes. ¿Valen la pena?
  • Límites por GPU time: Ollama no publica cifras exactas de minutos de GPU por plan. El plan Pro está diseñado para "day-to-day work", pero si mi uso es muy intensivo, podría tocar el límite.
  • No tiene Claude: si algún día quiero usar Sonnet u Opus, tendré que ir a otra plataforma.

Estimación: ¿cuánto uso puedo meter en Ollama Pro?

Ollama mide el uso por tiempo de GPU, no por tokens. Esto hace que la comparación directa con DeepSeek no sea exacta. Pero podemos hacer una estimación:

  • Plan Free: ~10-20 requests/día con modelos de nivel 3-4 (como DeepSeek V4 Flash).
  • Plan Pro: 50× Free = ~500-1.000 requests/día.

Mi uso actual: ~260 requests/día con DeepSeek V4 Flash.

Cálculo: mi uso actual representa entre el 26% y el 52% de la capacidad del plan Pro. Dicho al revés: con Ollama Pro podría hacer entre 2 y 4 veces mi uso actual antes de tocar el límite.

Traducido a cosas concretas, con Ollama Pro a 20 USD podría:

  • Seguir usando OpenClaw exactamente igual que ahora (~260 req/día)
  • Y además usar OpenCode con un modelo como Qwen 3.5 Coder o Kimi K2.7 Code para ~100-150 req/día de programación
  • Y además ejecutar un agente tipo Hermes para tareas de investigación (~50 req/día)
  • Y aún me sobraría margen para picos puntuales de uso

¿Me conviene? Depende de cuánto valore la predictibilidad y la libertad de modelos. Si DeepSeek sigue funcionando bien sin sorpresas, la diferencia de 15 USD/mes no se justifica solo por el ahorro. Pero si algún día DeepSeek cambia sus precios de caché o mete restricciones, Ollama Pro es la alternativa más sólida.


6. Conclusiones

Después de hacer los números y probar modelos, estas son mis conclusiones finales:

1. Me quedo con Qwen 3.7 Plus

Qwen 3.7 Plus es mi elección por dos razones principales:

  • Es multimodal: acepta texto, imagen y vídeo. Max solo acepta texto. Si quiero que OpenClaw analice una captura de pantalla, un documento escaneado o un gráfico, Plus es la única opción dentro de Qwen 3.7.
  • Es 6 veces más barato que Max: 0,40 USD/1M tokens input vs 2,50 USD/1M de Max. En output, 1,60 USD vs 7,50 USD. Para el 95% de mis tareas, Plus rinde igual que Max pero cuesta mucho menos.

2. DeepSeek V4 Flash tiene fallos puntuales

DeepSeek V4 Flash es mi daily driver (5,37 USD/mes gracias a los cache hits), pero no es perfecto. De vez en cuando tiene fallos puntuales en tareas cotidianas:

  • Algunos scripts de automatización se atascan o generan código incorrecto que requiere reintentos.
  • En tareas de razonamiento medio (no complejo, pero tampoco trivial), a veces toma atajos incorrectos.
  • Estos fallos son pocos (quizás 1 de cada 20-30 tareas), pero ocurren.

Para el 95% de mi uso (JSON, clasificación, extracción, código corto), Flash funciona perfectamente. Pero para ese 5% de tareas que requieren un poco más de razonamiento, necesito un modelo más capaz.

3. Comparación: DeepSeek V4 Pro vs Qwen 3.7 Plus

Aquí viene la pregunta interesante: ¿DeepSeek V4 Pro o Qwen 3.7 Plus para las tareas que requieren más capacidad?

Aspecto DeepSeek V4 Pro Qwen 3.7 Plus
Precio input (1M tokens) 0,435 USD 0,40 USD
Precio output (1M tokens) 0,87 USD 1,60 USD
Cache hit input 0,003625 USD 0,04 USD
Contexto 1M tokens 1M tokens
Max output 384K tokens 64K tokens
Multi-modal ❌ No (solo texto) ✅ Sí (texto + imagen + vídeo)
Modos de razonamiento 3 modos (Non-Thinking, Thinking High, Thinking Max) ✅ Sí (preserve_thinking)
Licencia MIT (open-weight) ❌ No (API propietaria)
Parámetros 1.6T total, 49B activos No publicado
Mejor en Razonamiento complejo, coding largo, matemáticas Tareas multi-modales, análisis visual, generación de código desde imágenes

Análisis:

  • Precio: son muy similares en input (~0,40-0,43 USD/1M). Pero DeepSeek V4 Pro es casi 2x más barato en output (0,87 vs 1,60 USD/1M). Y con cache hits, DeepSeek baja a 0,003625 USD/1M, mientras que Qwen baja a 0,04 USD/1M. DeepSeek gana en precio si tienes cache hits altos.
  • Capacidad de output: DeepSeek V4 Pro puede generar hasta 384K tokens de salida, mientras que Qwen 3.7 Plus solo 64K. Si necesitas generar documentos largos, código extenso o análisis detallados, DeepSeek gana.
  • Multi-modal: Qwen 3.7 Plus acepta imagen y vídeo; DeepSeek V4 Pro solo texto. Si necesitas análisis visual, Qwen gana.
  • Razonamiento: DeepSeek V4 Pro tiene 3 modos de razonamiento (incluyendo Thinking Max para tareas muy complejas). Qwen 3.7 Plus tiene extended thinking, pero no tan flexible. DeepSeek gana en razonamiento puro.
  • Open-weight: DeepSeek V4 Pro es MIT, puedes self-host. Qwen 3.7 Plus es API propietaria. DeepSeek gana si quieres control total.

Conclusión de la comparación: DeepSeek V4 Pro es mejor para razonamiento complejo, coding largo y tareas de solo texto. Qwen 3.7 Plus es mejor para tareas multi-modales (imagen/vídeo) y es ligeramente más barato en input.

4. Me quedo con Qwen 3.7 Plus en OpenCode Go

A pesar de que DeepSeek V4 Pro es más capaz en razonamiento, me quedo con Qwen 3.7 Plus en OpenCode Go por una razón práctica: los límites de OpenCode Go superan mi consumo habitual.

Mis números:

  • Mi consumo actual: ~260 requests/día, ~7.800 requests/mes
  • Límite de Qwen 3.7 Plus en OpenCode Go: 4.300 requests/5h, ~21.600 requests/mes
  • Margen: 21.600 - 7.800 = 13.800 requests de margen (casi el doble de mi uso actual)

¿Qué significa esto? Que puedo usar Qwen 3.7 Plus en OpenCode Go para todas mis tareas (heartbeats, boletines, chat, automatizaciones) sin preocuparme por tocar el límite. Y todo por 10 USD/mes (el precio de OpenCode Go), que incluye acceso a 16+ modelos.

Comparación con DeepSeek V4 Pro en OpenCode Go:

  • DeepSeek V4 Pro en OpenCode Go: 3.450 requests/5h, ~17.150 requests/mes
  • Mi consumo: 7.800 requests/mes
  • Margen: 17.150 - 7.800 = 9.350 requests

Ambos modelos me dan margen suficiente en OpenCode Go. Pero Qwen 3.7 Plus tiene dos ventajas:

  1. Es multimodal: puedo analizar imágenes y vídeos, algo que DeepSeek V4 Pro no puede hacer.
  2. Tiene más requests disponibles: 21.600 vs 17.150 requests/mes. Si mi uso crece, Plus me da más margen.

Resumen final

  • Daily driver: DeepSeek V4 Flash (5,37 USD/mes vía API directa). Barato gracias a los cache hits, aunque tiene fallos puntuales en tareas cotidianas.
  • Para tareas que requieren más capacidad: Qwen 3.7 Plus vía OpenCode Go (10 USD/mes). Multimodal, 6x más barato que Max, y los límites de OpenCode Go (21.600 requests/mes) superan mi consumo habitual (7.800 requests/mes).
  • Para razonamiento muy complejo: DeepSeek V4 Pro (también en OpenCode Go, 17.150 requests/mes) o Nemotron 3 Ultra (Ollama Cloud). Pero los uso poco.
  • Descartados: Qwen 3.7 Max (overkill, solo 4.770 requests/mes en OpenCode Go), Qwen Token Plan (prohíbe automatización), API directa de Qwen (182 USD/mes para Plus, inviable).

¿Y si DeepSeek cambia sus precios de caché? Si eso ocurre, OpenCode Go es mi plan B: 10 USD/mes, acceso a Qwen 3.7 Plus, DeepSeek V4 Pro, y otros 14 modelos, sin restricciones de automatización. Y si necesito aún más libertad, Ollama Cloud Pro (20 USD/mes, 40+ modelos).

¿Y si necesito análisis visual? Qwen 3.7 Plus es la opción. Acepta imagen y vídeo, algo que DeepSeek V4 Pro no puede hacer.

¿Y si necesito coding agent autónomo largo? Qwen 3.7 Max es el modelo (35+ horas de ejecución autónoma), pero solo tiene 4.770 requests/mes en OpenCode Go. Para eso, mejor uso DeepSeek V4 Pro o Nemotron 3 Ultra.


¿Tú qué usas? ¿Has probado Qwen 3.7 Plus o DeepSeek V4 Pro con OpenClaw? ¿Prefieres facturación fija o pay-as-you-go? Cuéntamelo en los comentarios.

📚 Enlaces útiles: