Qwen para “Prompt Engineering puro” — evaluación y elección
Fecha: 2026-09-16 · Trabajo: estado_turismo (ranking turístico, prompts SISTEMA/CONTEXTO/USUARIO/TAREA/OUTPUT)
Contexto
- Uso: prompt engineering iterativo (10–15h), español, salida JSON estricto.
- Hábitats: Mac M1 Pro 16GB (Ollama 0.30.10) y contenedor Hoody free-tier (x86_64, 6GB RAM, 50GB disco).
- Presupuesto: 5–10 opcional (API).
Criterios que deciden (en orden)
- Fidelidad al formato (JSON limpio, sin fences ni texto extra).
- Satisfacción de restricciones (<n empleados, <distancia, <precio, ordenar por score).
- Velocidad de iteración (segundos/turno).
- Consistencia entre runs (temp ~0.3, top_p 0.8, thinking OFF).
- Que quepa en la RAM del hábitat.
Catálogo 2026 (verificado)
- Qwen3 (2025): 8b/14b superados por 3.5.
- Qwen3.5 (feb 2026): 4b=3.4GB, 9b=6.6GB, 27b=17GB, 35b-A3B=24GB. 256K ctx.
- Qwen3.6 (abr 2026): 27b dense (Q4 ~17GB), 35b-A3B (Q4 ~22GB). Fuera de 16GB.
- Qwen3.8 (ago 2026): 27b (Q4 ~16.5GB), 2.4T-A95B.
Modelo propio qwen3.6:latest (36B MoE, 23GB)
Descartado para este uso en 16GB (paginado → latencia mata la iteración #3). Solo útil con server grande (Hoody marketplace) o API.
Decisión
- Mac local ($0): qwen3.5:9b (6.6GB Q4). Fallback velocidad: qwen3.5:4b.
- Hoody free-tier: qwen3.5:4b expuesto en
http-11434(Ollama remoto). - Server grande Hoody / API: qwen3.6:27b o 35b-A3B (server); DeepSeek/qwen-max solo como juez de prompts.
Configuración para el loop
- Thinking OFF (rama instruct / /no_think).
- temp ~0.3, top_p 0.8.
- Template: añadir al OUTPUT “JSON válido, sin markdown, devuelve null si viola restricción”.
Próximo paso opcional
Pull y A/B empírico: ollama pull qwen3.5:9b y comparar contra qwen3.5:4b con el prompt de Tulum/Bacalar/Cozumel.