Qwen para “Prompt Engineering puro” — evaluación y elección

Fecha: 2026-09-16 · Trabajo: estado_turismo (ranking turístico, prompts SISTEMA/CONTEXTO/USUARIO/TAREA/OUTPUT)

Contexto

  • Uso: prompt engineering iterativo (10–15h), español, salida JSON estricto.
  • Hábitats: Mac M1 Pro 16GB (Ollama 0.30.10) y contenedor Hoody free-tier (x86_64, 6GB RAM, 50GB disco).
  • Presupuesto: 5–10 opcional (API).

Criterios que deciden (en orden)

  1. Fidelidad al formato (JSON limpio, sin fences ni texto extra).
  2. Satisfacción de restricciones (<n empleados, <distancia, <precio, ordenar por score).
  3. Velocidad de iteración (segundos/turno).
  4. Consistencia entre runs (temp ~0.3, top_p 0.8, thinking OFF).
  5. Que quepa en la RAM del hábitat.

Catálogo 2026 (verificado)

  • Qwen3 (2025): 8b/14b superados por 3.5.
  • Qwen3.5 (feb 2026): 4b=3.4GB, 9b=6.6GB, 27b=17GB, 35b-A3B=24GB. 256K ctx.
  • Qwen3.6 (abr 2026): 27b dense (Q4 ~17GB), 35b-A3B (Q4 ~22GB). Fuera de 16GB.
  • Qwen3.8 (ago 2026): 27b (Q4 ~16.5GB), 2.4T-A95B.

Modelo propio qwen3.6:latest (36B MoE, 23GB)

Descartado para este uso en 16GB (paginado → latencia mata la iteración #3). Solo útil con server grande (Hoody marketplace) o API.

Decisión

  • Mac local ($0): qwen3.5:9b (6.6GB Q4). Fallback velocidad: qwen3.5:4b.
  • Hoody free-tier: qwen3.5:4b expuesto en http-11434 (Ollama remoto).
  • Server grande Hoody / API: qwen3.6:27b o 35b-A3B (server); DeepSeek/qwen-max solo como juez de prompts.

Configuración para el loop

  • Thinking OFF (rama instruct / /no_think).
  • temp ~0.3, top_p 0.8.
  • Template: añadir al OUTPUT “JSON válido, sin markdown, devuelve null si viola restricción”.

Próximo paso opcional

Pull y A/B empírico: ollama pull qwen3.5:9b y comparar contra qwen3.5:4b con el prompt de Tulum/Bacalar/Cozumel.