Logo IES Simarro
PP1-Simarro Centro de excelencia en IA y BD

Banco de Benchmarks

Documentación pública de las campañas de medición de inferencia LLM del centro: servidor, modelo, metodología, resultados y limitaciones. Datos reales, extraídos de producción y de benches controlados, publicados para que cualquier institución pueda replicarlos.

Nodo Titán · En producción 24/7

Qwen 3.8 Flash Next — vLLM en 3× RTX PRO 6000 Blackwell

El modelo insignia del centro servido con jerarquía de memoria GPU→CPU: ~94 GB de VRAM para pesos + KV residente y ~100 GB de DDR5 ECC de offload por instancia. Concurrencia real, percentiles de latencia, ráfagas simultáneas y conclusiones del plan de memoria.

602tok/s pico por GPU
1.668tok/s pico clúster
81,8 %prefill cacheado
524Ktok contexto/petición
Nodo Titán · Campaña junio 2026

Qwen 3.5 & Gemma — comparativa de formatos (NVFP4 vs FP8 vs bf16)

GPU dedicada limpia, decodificación greedy y dos métodos de medición (cliente propio + vllm bench serve). Ocho modelos de 0,8 B a 122 B para responder a la pregunta clave de Blackwell: qué formato cuantizar y cuándo. Incluye el techo de 35.841 tok/s totales con un 0,8 B.

35.841tok/s totales (0,8B)
+74 %NVFP4 vs bf16 (4B)
534tok/s single-stream
8modelos medidos
Array DGX Spark · Servicio de aula

DGX Spark — Qwen 3.6, Gemma 4 y decodificación especulativa

El banco de pruebas del array de NVIDIA DGX Spark (GB10 Grace Blackwell, 128 GB unificados): 10 configuraciones de modelo y speculative decoding (MTP, DFlash, n-gram) en 3 escenarios de aula, barridos de concurrencia multiusuario, la elección de Gemma 4 para el servicio didáctico y el incidente documentado del 397B en dual-Spark.

107,6tok/s spec DFlash
~239tok/s agregados
16,0tok/s Gemma 31B FP8
10config probadas

Criterio común de medición

Todas las campañas siguen el mismo protocolo: decodificación greedy (temperature=0), conteo de tokens del servidor (no estimaciones del cliente), y publicación explícita de limitaciones en cada página. Preferimos números menos favorecedores pero reproducibles antes que picos de laboratorio: cada cifra publicada está trazable a un log, un /metrics o un script versionado en el repositorio del centro.