Labs Digind
Benchmarks públicos para medir modelos económicos frente a los más usados.
Alternativas de bajo coste y open weights frente a modelos cerrados en coding: SWE-bench, LiveCodeBench, LiveSWEBench y Terminal-Bench.
Económicos vs. modelos más usados
Comparativa neutra de alternativas de bajo coste frente a modelos cerrados. Ordena por rendimiento, velocidad, coste y contexto.
Distancia frente al líder
Barras y radar con métricas públicas. Próximamente: planes de coding por modelo.
Perfil de alternativas
radar · 4 benchmarksComparativa cruzada
Cambios en la lista de modelos
Registro cronológico de altas y bajas. Cada entrada indica cuándo un modelo se sumó o se retiró.
Criterio de medición
Fuentes públicas: arquitectura, generación, edición IDE y DevOps. Solo indicadores objetivos para comparar cercanía al líder.
SWE-bench (Verified & Live)
Issues reales de GitHub resueltos end-to-end. Estándar para lógica, arquitectura y refactor en repos completos.
LiveCodeBench (LCB)
Problemas frescos de LeetCode, AtCoder y CodeForces. Mide generación de código y razonamiento competitivo sin contaminación.
LiveSWEBench · Targeted Editing
Proxy para asistentes de IDE: edición dirigida con prompt y archivo en contexto, modo agente.
Terminal-Bench Hard
Tareas difíciles de terminal: scripts, DevOps, administración y pipelines CLI en entornos realistas.