QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi...
TL;DR
QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi…
El modelo de la arquitectura Qwen4 ya está publicado en abierto y los datos son oficiales: 125B parámetros con solo 6B activos por token, más 51B de embeddings N-gram y contexto de 262K extensible a 1M. Analizamos la ficha real, la nueva atención QSA, los benchmarks que lo colocan en el #1 de agéntica y código frente a Claude Opus y DeepSeek, y si de verdad puedes correrlo en local.
Capítulos del vídeo
- 0:00 — Introducción — el modelo ya está publicado
- 0:26 — Ficha oficial — 125B, 6B activos, 51B N-gram, 262K de contexto
- 1:00 — Arquitectura Qwen4 — QSA, Gated Residual, N-gram y receta de entrenamiento
- 1:40 — Benchmarks de código — DeepSWE 58.7, SWE-bench Pro 62.5
- 2:12 — Agéntico y multimodal — CoWorkBench, JobBench, AndroidWorld
- 2:46 — Datos generales — GPQA 91.7, LiveCodeBench 91.9
- 3:20 — En local — la verdad del tamaño (≈180B totales)
- 3:52 — Licencia y cierre — Qwen Community 1.0, SGLang, vLLM, TokenSpeed
El contexto
DATOS CLAVE
Análisis
-
125B parámetros totales en MoE, con solo 6B activados por token
-
+51B de embeddings N-gram y +4B MTP (predictor multi-token)
-
Contexto nativo de 262.144 tokens, extensible a 1.000.000 (YaRN)
Puntos clave
- Ver datos y cifras en el vídeo: https://www.youtube.com/watch?v=oiTiVTk9Ex4
- Investigación previa documentada en el pipeline de vídeo (research.md del proyecto)
- Fuentes primarias listadas a continuación
Fuentes
Conclusión
- 512 expertos, 10 enrutados + 1 compartido, arquitectura Qwen4
Artículo generado automáticamente desde el vídeo publicado en nramosdev. Cada número citado proviene de la investigación verificada del pipeline.