NRamosDev · Blog

QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi...

#youtube#nramosdev#ia#análisis

TL;DR

QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi…

El modelo de la arquitectura Qwen4 ya está publicado en abierto y los datos son oficiales: 125B parámetros con solo 6B activos por token, más 51B de embeddings N-gram y contexto de 262K extensible a 1M. Analizamos la ficha real, la nueva atención QSA, los benchmarks que lo colocan en el #1 de agéntica y código frente a Claude Opus y DeepSeek, y si de verdad puedes correrlo en local.

Capítulos del vídeo

  • 0:00 — Introducción — el modelo ya está publicado
  • 0:26 — Ficha oficial — 125B, 6B activos, 51B N-gram, 262K de contexto
  • 1:00 — Arquitectura Qwen4 — QSA, Gated Residual, N-gram y receta de entrenamiento
  • 1:40 — Benchmarks de código — DeepSWE 58.7, SWE-bench Pro 62.5
  • 2:12 — Agéntico y multimodal — CoWorkBench, JobBench, AndroidWorld
  • 2:46 — Datos generales — GPQA 91.7, LiveCodeBench 91.9
  • 3:20 — En local — la verdad del tamaño (≈180B totales)
  • 3:52 — Licencia y cierre — Qwen Community 1.0, SGLang, vLLM, TokenSpeed

El contexto

DATOS CLAVE

Análisis

  • 125B parámetros totales en MoE, con solo 6B activados por token

  • +51B de embeddings N-gram y +4B MTP (predictor multi-token)

  • Contexto nativo de 262.144 tokens, extensible a 1.000.000 (YaRN)

Puntos clave

Fuentes

Conclusión

  • 512 expertos, 10 enrutados + 1 compartido, arquitectura Qwen4

Artículo generado automáticamente desde el vídeo publicado en nramosdev. Cada número citado proviene de la investigación verificada del pipeline.

([nr])

¿Te ha gustado? Suscríbete al canal para más análisis de IA en español.

Ver en YouTube

Artículos relacionados