○ unseen · kind tool · level 0 · 0h
- Requiere: Large Language Models
- Aplica: Model Deployment
Groq ofrece una capa de inferencia ultrarrápida para backend, pero con límites estrictos por minuto (TPM/ITPM) en el tier gratuito. Se ha observado que gpt-oss-120b consume ~389ms internos pero la latencia total varía según contexto enviado. El modelo tiende a sobre-resolver tareas simples si no se restringe con instrucciones de “solo código”.
Mecanismo
La arquitectura utiliza Groq como motor de inferencia para OpenCode o CLI directa (curl). Se debe gestionar el tamaño del input (ITPM) y tokens por minuto (TPM). El modelo gpt-oss-120b muestra latencias bajas (~389ms internos), pero las solicitudes completas pueden fallar si exceden 7000 ITPM o 8000 TPM. Se recomienda compactación automática (compaction.auto: true) y poda de historial para mantener el input bajo 5-6K tokens antes del envío.
Límite
El tier gratuito impone un límite estricto de entrada (ITPM) que se alcanza rápidamente con agentes complejos o contextos largos (>20k tokens). El error “Request too large” indica rechazo en la fase de validación, no por capacidad computacional. No es viable usar Groq Free para sesiones largas acumulativas sin una estrategia agresiva de resumen incremental (raw -> summary).
Ejercicio
- Configurar
opencode.jsoncon compaction automática y whitelist restringida a modelos GPT-OSS/Qwen activos. - Crear wrapper CLI local (
.zshrc) para llamadas directas que controlen el tamaño del prompt antes de enviarlo. - Probar latencia comparativa: 8B vs 120B en tareas simples sin contexto acumulado.
Enlaces
- Requiere: Large Language Models
- Aplica: Model Deployment