Benchmark Cloudflare Workers AI vía opencode — 2026-09-06
Script: ~/nef/sandbox-sep-6/cf-bench.py (reusable; agrega modelos a MODELS
y tareas con checker determinista a TASKS).
Resultados JSON: ~/nef/sandbox-sep-6/cf-bench-results.json.
Setup
opencode run --pure --format json -m cloudflare-workers-ai/<modelo>(5 tareas × 4 modelos, todo free tier, costo $0).- Disponibles en la conexión: nemotron-3-120b-a12b, gpt-oss-120b, gemma-4-26b-a4b-it, deepseek-r1-distill-qwen-32b.
- NO disponibles (error provider): llama-3.3-70b, llama-3.1-8b, mistral-small-24b, qwen3-30b.
cloudflare-ai-gatewayfalló con “no route for model” — revisar config del gateway aparte.
Resultado ronda 1 (saturada: 5/5 todos)
| Modelo | Lat avg | Out tokens | Nota |
|---|---|---|---|
| nemotron-3-120b | 6.2s | 1,213 | mejor global, salida sin fences |
| gemma-4-26b | 6.2s | 818 | numéricamente descuidado (17,631.69 vs .94) |
| gpt-oss-120b | 9.5s | 903 | sólido |
| r1-distill-qwen-32b | 16.3s | 1,785 | 3x latencia para mismo score |
Conclusión: para tareas triviales, nemotron-3-120b gratis reemplaza pagos. Tareas demasiado fáciles → se necesita ronda 2 (multi-step, contexto largo, edición de código) para separar nemotron vs gpt-oss.