Qwen 3.8 Flash Next — vLLM en 3× RTX PRO 6000 Blackwell
El modelo insignia del centro servido con jerarquía de memoria GPU→CPU: ~94 GB de VRAM para pesos + KV residente y ~100 GB de DDR5 ECC de offload por instancia. Concurrencia real, percentiles de latencia, ráfagas simultáneas y conclusiones del plan de memoria.
Qwen 3.5 & Gemma — comparativa de formatos (NVFP4 vs FP8 vs bf16)
GPU dedicada limpia, decodificación greedy y dos métodos de medición (cliente propio +
vllm bench serve). Ocho modelos de 0,8 B a 122 B para responder a la pregunta clave de
Blackwell: qué formato cuantizar y cuándo. Incluye el techo de 35.841 tok/s totales con un 0,8 B.
DGX Spark — Qwen 3.6, Gemma 4 y decodificación especulativa
El banco de pruebas del array de NVIDIA DGX Spark (GB10 Grace Blackwell, 128 GB unificados): 10 configuraciones de modelo y speculative decoding (MTP, DFlash, n-gram) en 3 escenarios de aula, barridos de concurrencia multiusuario, la elección de Gemma 4 para el servicio didáctico y el incidente documentado del 397B en dual-Spark.
Criterio común de medición
Todas las campañas siguen el mismo protocolo: decodificación greedy (temperature=0),
conteo de tokens del servidor (no estimaciones del cliente), y publicación explícita de
limitaciones en cada página. Preferimos números menos favorecedores pero reproducibles antes que
picos de laboratorio: cada cifra publicada está trazable a un log, un /metrics o un
script versionado en el repositorio del centro.