Benchmark Cloudflare Workers AI vía opencode — 2026-09-06

Script: ~/nef/sandbox-sep-6/cf-bench.py (reusable; agrega modelos a MODELS y tareas con checker determinista a TASKS). Resultados JSON: ~/nef/sandbox-sep-6/cf-bench-results.json.

Setup

  • opencode run --pure --format json -m cloudflare-workers-ai/<modelo> (5 tareas × 4 modelos, todo free tier, costo $0).
  • Disponibles en la conexión: nemotron-3-120b-a12b, gpt-oss-120b, gemma-4-26b-a4b-it, deepseek-r1-distill-qwen-32b.
  • NO disponibles (error provider): llama-3.3-70b, llama-3.1-8b, mistral-small-24b, qwen3-30b.
  • cloudflare-ai-gateway falló con “no route for model” — revisar config del gateway aparte.

Resultado ronda 1 (saturada: 5/5 todos)

ModeloLat avgOut tokensNota
nemotron-3-120b6.2s1,213mejor global, salida sin fences
gemma-4-26b6.2s818numéricamente descuidado (17,631.69 vs .94)
gpt-oss-120b9.5s903sólido
r1-distill-qwen-32b16.3s1,7853x latencia para mismo score

Conclusión: para tareas triviales, nemotron-3-120b gratis reemplaza pagos. Tareas demasiado fáciles → se necesita ronda 2 (multi-step, contexto largo, edición de código) para separar nemotron vs gpt-oss.