Tencent Hy4 preview: 770B parámetros, 49B activos y contexto 1M. Benchmarks, precio y comparación con Kimi K3, GLM-5.3 y Claude Opus 5 Skip to content

Tencent Hy4 preview: 770B parámetros, 49B activos y contexto 1M. Benchmarks, precio y comparación con Kimi K3, GLM-5.3 y Claude Opus 5

Análisis verificado de Tencent Hy4 preview: arquitectura MoE 770B/49B, contexto 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, blind test interno, precio API, self-hosting, FP8, vLLM/SGLang y límites preview.

Publicado Escrito por Tiempo de lectura 16 min de lectura

Análisis verificado de Tencent Hy4 preview: arquitectura MoE 770B/49B, contexto 1M, Gated DSA, IndexCache, MTP, Apache 2.0, benchmarks, blind test interno, precio API, self-hosting, FP8, vLLM/SGLang y límites preview.

En esta página
  1. 1TL;DR
  2. 2¿Qué publicó Tencent?
  3. 3770B no significa 770B activos por token
  4. 4Organización de expertos
  5. 5Hy4 vs Hy3: gran salto de escala
  6. 6Contexto de 1M tokens
  7. 7Gated DeepSeek Sparse Attention
  8. 8¿Qué hace IndexCache?
  9. 9Capa MTP nativa
  10. 10Los pesos son realmente públicos
  11. 11Apache 2.0
  12. 12Self-hosting oficial
  13. 13API compatible con OpenAI
  14. 14Se puede reducir el reasoning
  15. 15Limitaciones oficiales de preview
  16. 16Benchmarks: caveat primero
  17. 17Resultados seleccionados
  18. 18SWE-bench Multilingual: 82,9%
  19. 19SWE-bench Pro: 65,7%
  20. 20DeepSWE: salto generacional
  21. 21Terminal-Bench 2.1: 85,4%
  22. 22GPQA Diamond: 92,3%
  23. 23MCP-Atlas y agentes con tools
  24. 24Hy4 vs Kimi K3 y GLM-5.3: blind test interno
  25. 25Claude Opus 5 y GPT-5.6 Sol
  26. 26Precio API
  27. 27Self-hosting vs API
  28. 28¿Hy4 se “optimizó a sí mismo”?
  29. 29¿Qué significa +31,8% throughput?
  30. 30Ventajas principales
  31. 31Riesgos e incógnitas
  32. 32¿Cómo debería benchmarkearlo una empresa?
  33. 33Checklist de deployment
  34. 34¿Vale la pena migrar desde Hy3?
  35. 35Veredicto POLPROG

El 28 de agosto de 2026 Tencent publicó y abrió Hy4 preview, su nuevo modelo flagship Mixture-of-Experts de la familia Tencent Hy, antes más conocida como Hunyuan.[1][6]

Especificación principal:

770B parámetros totales
49B parámetros activos por token
78 capas
256 routed experts + 1 shared expert
top-8 routed experts activos por token
contexto 1M
Apache License 2.0

[2]

Tencent publicó los pesos completos y Hy4 preview-FP8. El repositorio completo en Hugging Face ocupa aproximadamente 1,56 TB.[2][3]

El modelo está orientado a software engineering, trabajo de oficina, análisis financiero, game development, investigación científica y agentes con herramientas.[1][2]

Tres puntos importan especialmente.

Primero, los pesos están bajo Apache 2.0, lo que permite self-hosting y uso comercial sujeto a la licencia.[2][4]

Segundo, Tencent reporta resultados altos en coding y agents: 82,9% en SWE-bench Multilingual, 85,4% en Terminal-Bench 2.1 y 83,7% en MCP-Atlas.[2][9]

Tercero, Tencent afirma que Hy4 participó en la optimización de su propio proceso de desarrollo e infraestructura de inference. Una de esas iteraciones aumentó el throughput end-to-end un 31,8% frente al baseline interno de Tencent.[1]

Eso no significa que Hy4 se haya entrenado de manera totalmente autónoma. La empresa describe una etapa temprana de recursive self-improvement aplicada al proceso de ingeniería.

Estado de la información: 31 de agosto de 2026.

TL;DR

PreguntaRespuesta verificada
ModeloTencent Hy4 preview
Lanzamiento28 de agosto de 2026
TipoMixture-of-Experts
Parámetros totales770B
Parámetros activos49B por token
Capas78
Routed experts256
Shared experts1
Routed experts activostop-8
Contexto1M en model card, 1.048.576 en OpenRouter
Max output OpenRouter64K
AttentionGated DeepSeek Sparse Attention
Optimización sparse attentionIndexCache
MTP1 capa nativa, 10B total / 0,7B activos
LicenciaApache 2.0
Pesos completosaprox. 1,56 TB
Variante cuantizadaHy4 preview-FP8
Self-hostingvLLM y SGLang
Recipe oficialtensor parallel size 8
API input$0.834 / 1M tokens
API output$2.501 / 1M tokens
Cache hit$0.042 / 1M tokens
SWE-bench Multilingual82,9%, Tencent-reported
SWE-bench Pro65,7%, Tencent-reported
Terminal-Bench 2.185,4%, Tencent-reported
GPQA Diamond92,3%, Tencent-reported
MCP-Atlas83,7%, Tencent-reported
EstadoPreview
Limitacionesreasoning demasiado largo y over-verification
Caveat principalsin replicación independiente amplia de toda la tabla de lanzamiento

¿Qué publicó Tencent?

Tencent puso a disposición:

Hy4 preview
Hy4 preview-FP8

en Hugging Face, ModelScope, GitCode y CNB.[2]

También está disponible vía WorkBuddy, CodeBuddy, Tencent Cloud TokenHub y OpenRouter.[1][7]

Reuters confirmó el lanzamiento del 28 de agosto y los usos anunciados en software engineering, research y financial analysis.[6]

770B no significa 770B activos por token

Hy4 utiliza Mixture-of-Experts.

El backbone tiene:

770B total

pero activa aproximadamente:

49B

por token.[2]

Eso equivale a cerca del 6,4% del backbone.

MoE reduce el cálculo activo por token, pero no elimina la necesidad de almacenar y distribuir un modelo enorme.

Organización de expertos

El backbone tiene 78 capas.[2]

La primera usa un FFN dense.

Las otras 77 contienen:

256 routed experts
1 shared expert

Por token se activan:

top-8 routed experts
+
shared expert

[2]

Hy4 vs Hy3: gran salto de escala

Hy3:

295B total
21B active
256K context

[5][12]

Hy4 preview:

770B total
49B active
1M context

[2]

Es aproximadamente:

  • 2,61× más parámetros totales,
  • 2,33× más parámetros activos,
  • al menos 3,9× más contexto declarado.

Tencent dice que amplió a la vez tamaño, contexto, datos de entrenamiento y post-training.[2]

Contexto de 1M tokens

La model card indica:

Context Length: 1M

[2]

OpenRouter expone:

1,048,576 tokens
64,000 max completion tokens

[7]

Es útil para codebases grandes, sesiones largas de agentes, análisis multi-documento y research.

Pero contexto máximo y calidad efectiva de recuperación no son equivalentes.

Gated DeepSeek Sparse Attention

Hy4 usa Gated DeepSeek Sparse Attention.[2]

Sparse attention intenta reducir el coste de secuencias largas seleccionando posiciones relevantes en lugar de aplicar full quadratic attention en todos los puntos.

Tencent lo combina con:

IndexCache

¿Qué hace IndexCache?

IndexCache reutiliza sparse indices entre capas.[8]

El paper muestra que, en los modelos DSA evaluados, puede reducir trabajo del indexer y acelerar prefill/decode con impacto pequeño en calidad.[8]

Esos resultados pertenecen al trabajo de IndexCache, no a una medición directa de Hy4.

Capa MTP nativa

Además del backbone, Hy4 incluye una capa Multi-Token Prediction.[2]

Tencent especifica:

10B total
0.7B activos

Se utiliza para speculative decoding y aparece habilitada en los recipes oficiales de vLLM y SGLang.[2]

Los pesos son realmente públicos

Hugging Face muestra:

tencent/Hy4-preview
1.56 TB
131 shards safetensors
Apache-2.0

[3]

También existe:

tencent/Hy4-preview-FP8

[11]

Esto permite self-hosting, fine-tuning, análisis y stacks propios de inference.

Apache 2.0

La model card y el repositorio oficial indican:

Apache License 2.0

[2][4]

Es una licencia permisiva que admite uso, modificación y distribución, también comercial, bajo sus condiciones.

Self-hosting oficial

Tencent recomienda:

vLLM
SGLang

[2]

El recipe vLLM usa:

vllm/vllm-openai:hy4-preview

y:

--tensor-parallel-size 8

[2]

SGLang usa --tp-size 8.

Eso no significa que ocho GPU cualquiera sean suficientes. Memoria, precision, KV cache, contexto y concurrency importan.

API compatible con OpenAI

Tras desplegarlo con vLLM/SGLang se puede llamar mediante endpoint compatible con OpenAI.[2]

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "Review this repository architecture."}],
    temperature=0.9,
    top_p=1.0,
)

Tencent recomienda temperature=0.9 y top_p=1.0.[2]

Se puede reducir el reasoning

Por defecto, Hy4 usa un nivel alto de reasoning para tareas difíciles.[2]

Para respuestas más directas:

extra_body={
    "chat_template_kwargs": {
        "reasoning_effort": "no_think"
    }
}

Es relevante porque el reasoning excesivamente largo es una limitación oficial.

Limitaciones oficiales de preview

Tencent admite:[2][6]

  1. puede dedicar más tiempo del necesario a tareas complejas,
  2. tiende a over-verify su propio trabajo.

En agentes esto puede aumentar tool calls, latency y coste.

Benchmarks: caveat primero

Tencent publicó un benchmark appendix en la model card.[2]

A 31 de agosto todavía no existe una replicación independiente amplia y con configuración idéntica de toda la tabla.

Por ello marcamos los resultados como:

Tencent-reported

Resultados seleccionados

Transcripción de la tabla de Tencent:[2][9][10]

BenchmarkHy4 preview
GPQA Diamond92,3%
Terminal-Bench 2.185,4%
MCP-Atlas83,7%
SWE-bench Multilingual82,9%
MathArena Apex 202574,2%
SWE-bench Pro65,7%
DeepSWE64,3%
HLE, High + Tools55,4%
HLE, High sin tools43,4%

Todos son vendor-reported.

SWE-bench Multilingual: 82,9%

Tencent reporta:

Hy4 preview: 82.9%
Hy3: 75.8%

[9]

Son +7,1 puntos.

Para compararlo con otros resultados hay que verificar variante de benchmark y harness.

SWE-bench Pro: 65,7%

Tencent reporta:

Hy4 preview: 65.7%
Hy3: 57.9%

[9][10]

Son +7,8 puntos y una señal clara de mejora en software engineering.

DeepSWE: salto generacional

La transcripción indica:

Hy3: 28.0%
Hy4 preview: 64.3%

[9]

Precisamente por el tamaño del salto, la replicación independiente es especialmente importante.

Terminal-Bench 2.1: 85,4%

Tencent reporta:

Hy4 preview: 85.4%

[9][10]

Es muy fuerte para coding agents, pero el mismo chart muestra competidores con valores comparables o superiores. No demuestra una victoria universal.

GPQA Diamond: 92,3%

Resultado Tencent-reported:

92.3%

[9][10]

Apoya el posicionamiento en scientific reasoning.[1]

No garantiza fiabilidad en investigación real.

MCP-Atlas y agentes con tools

Tencent reporta:

MCP-Atlas: 83.7%

[9][10]

OpenRouter confirma soporte de tools, tool_choice y structured outputs con JSON Schema.[7]

Hy4 vs Kimi K3 y GLM-5.3: blind test interno

Tencent realizó:[1][2]

163 expertos Tencent
203 tareas de ingeniería
escala 0–4

Promedios:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[1]

Contra Kimi K3:

51.2% wins
7.9% ties
40.9% losses

Contra GLM-5.3:

46.8% wins
12.8% ties
40.4% losses

[2]

Es una ventaja pequeña en un workload interno de Tencent, no prueba universal.

Claude Opus 5 y GPT-5.6 Sol

Tencent también los incluye en su benchmark appendix.[9]

SWE-bench Multilingual:

Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%

Terminal-Bench 2.1:

Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%

[9]

Los valores dobles representan configuraciones/variantes del chart de Tencent y no deben mezclarse en un ranking único.

Precio API

Tencent publica:[1]

Input:      $0.834 / 1M tokens
Output:     $2.501 / 1M tokens
Cache hit:  $0.042 / 1M tokens

OpenRouter muestra las mismas tarifas.[7][13]

Precio por token no es coste por tarea. Reasoning largo y más tool calls pueden cambiar la economía real.

Self-hosting vs API

API

Adecuada para adopción rápida, demanda variable y cuando no se quiere operar un cluster GPU grande.

Self-hosting

Útil para data residency, control de inference y workloads grandes/estables.

Con alrededor de 1,56 TB de pesos completos, no es un modelo típico de una sola workstation.[3]

¿Hy4 se “optimizó a sí mismo”?

Tencent dice que participó en optimización automática de training methods, data strategies, evaluation frameworks y low-level operators.[1]

Proponía enfoques, ejecutaba experimentos e iteraba usando resultados.

Tencent lo llama:

early-stage recursive self-improvement loop

No equivale a decir que el modelo se entrenó solo.

¿Qué significa +31,8% throughput?

Tencent afirma que Hy4 analizó bottlenecks e iteró sobre operator fusion y communication optimization.[1]

Resultado:

+31.8% end-to-end throughput
vs baseline interno Tencent

No significa 31,8% más rápido que Kimi, Claude o GPT.

Ventajas principales

  • Apache 2.0.
  • Contexto 1M.
  • 49B activos de 770B total.
  • Buen perfil coding/agent según Tencent.
  • Recipes oficiales vLLM/SGLang.
  • FP8.
  • Precio API competitivo.

Riesgos e incógnitas

  • Preview.
  • Benchmarks mayoritariamente vendor-reported.
  • Over-reasoning.
  • Over-verification.
  • Gran infraestructura para self-hosting.
  • Calidad real del contexto 1M por validar.
  • Data governance depende del provider cuando se usa API.

¿Cómo debería benchmarkearlo una empresa?

Comparar con tareas idénticas:

Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol

Medir:

  • task completion,
  • test pass rate,
  • calidad del diff,
  • tool calls,
  • retries,
  • tokens,
  • latency,
  • coste por tarea,
  • regresiones,
  • cambios fuera de scope,
  • long-context quality.

Métrica clave:

cost per successful task

Checklist de deployment

Calidad

  • Probar tareas internas.
  • Separar benchmarks Tencent de resultados independientes.
  • Comparar high reasoning y no_think.
  • Medir over-verification.
  • Probar alucinaciones.
  • Validar tool calling.
  • Validar structured outputs.
  • Probar sesiones largas de agentes.

Long context

  • Probar 32K, 128K, 256K y más.
  • Medir retrieval accuracy.
  • Medir time-to-first-token.
  • Medir KV-cache footprint.
  • No asumir que 1M context = 1M memoria perfecta.
  • Probar repo-level coding.
  • Probar cross-document reasoning.
  • Probar prompt injection en contexto largo.

Self-hosting

  • Verificar requisitos GPU.
  • Empezar con FP8 oficial.
  • Probar vLLM.
  • Probar SGLang.
  • Medir throughput con concurrency real.
  • Medir P50/P95/P99.
  • Planificar storage.
  • Revisar Apache 2.0 con legal.

API

  • Verificar precio actual.
  • Revisar cache semantics y TTL.
  • Revisar data retention.
  • Revisar región.
  • Definir límites de coste.
  • Monitorizar uso por agente.
  • Mantener fallback model.
  • Medir cost per successful task.

¿Vale la pena migrar desde Hy3?

Para usuarios de Hy3, Hy4 merece un POC.

Sobre el papel:

295B → 770B total
21B → 49B active
256K → 1M context

más grandes mejoras vendor-reported en coding y agents.[2][5][9]

Pero Hy4 puede razonar más tiempo, necesita más infraestructura y sigue siendo preview.

Veredicto POLPROG

Hy4 preview es uno de los lanzamientos open-weight más importantes de finales de agosto de 2026.

Lo relevante es la combinación:

770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
precio API agresivo
perfil coding/agent fuerte

Hay que separar tres niveles de evidencia.

Hechos técnicos

Arquitectura, licencia, pesos, contexto, deployment y precio están bien documentados.[1][2][3][7]

Benchmarks

Son fuertes, pero al lanzamiento siguen siendo principalmente Tencent-reported.[2][9][10]

Self-improvement

Forma parte del proceso R&D descrito, pero no es self-training totalmente autónomo.[1]

Conclusión razonable al 31 de agosto:

Hy4 preview debe estar en la shortlist para coding agents, research agents, workflows long-context e infraestructura AI self-hosted.

Todavía no hay base para decir:

Hy4 es el mejor modelo del mundo.

Sí hay base para decir:

Tencent ha colocado Hy4 en el pequeño grupo de modelos open-weight que ya no se pueden ignorar al diseñar un stack AI de producción.

Tencent Hy4 Hy4 preview Hunyuan open source AI open weights Mixture of Experts Kimi K3 GLM-5.3 Claude Opus 5 coding AI

Preguntas frecuentes

Fecha de lanzamiento

28 de agosto de 2026.

¿Open source?

Tencent lo denomina open source y publica pesos/código bajo Apache 2.0.

Parámetros

770B total, 49B activos por token en el backbone.

¿MTP está incluido en 770B?

No según model card: añade 10B total / 0,7B activos.

Contexto

1M en model card, 1.048.576 en OpenRouter.

Max output

64K en OpenRouter.

Self-hosting

Sí.

Frameworks oficiales

vLLM y SGLang.

¿FP8?

Sí.

Tamaño de pesos

Aproximadamente 1,56 TB.

Licencia

Apache 2.0.

Precio API

$0.834/1M input, $2.501/1M output, $0.042/1M cache.

¿Ganó a Kimi K3?

En el blind test interno Tencent: 2.99/4 vs 2.94/4. No es prueba independiente universal.

¿Y GLM-5.3?

2.99 vs 2.92 en el mismo test.

¿Claude Opus 5?

No hay base para una afirmación global de superioridad.

¿Benchmarks independientes?

Todavía no hay replicación amplia de toda la tabla Tencent.

Limitaciones conocidas

Reasoning demasiado largo y over-verification.

¿Hy4 se mejoró solo?

Tencent describe experimentación automatizada asistida por el modelo, no entrenamiento autónomo completo.

+31,8% throughput

Mejora frente al baseline interno de inference de Tencent, no frente a modelos competidores.

Fuentes y notas

  1. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 de agosto de 2026, consultado el 31 de agosto de 2026.123456789101112
  2. Tencent, Hy4 preview — model card oficial en Hugging Face, consultado el 31 de agosto de 2026.1234567891011121314151617181920212223242526272829
  3. Hugging Face, tencent/Hy4-preview — files and versions, consultado el 31 de agosto de 2026.1234
  4. Tencent-Hunyuan, Hy4-preview — repositorio GitHub oficial, consultado el 31 de agosto de 2026.12
  5. Tencent, Hy3 Now Available Globally, 5 de agosto de 2026.12
  6. Reuters, China's Tencent releases new open-source AI model for coding, research tasks, 28 de agosto de 2026.123
  7. OpenRouter, Tencent: Hy4 preview, estado comprobado el 31 de agosto de 2026.12345
  8. Bai et al., IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse, arXiv:2603.12201, marzo de 2026.12
  9. AI/TLDR, Hunyuan Hy4 preview — benchmark appendix transcription, 28 de agosto de 2026. Valores transcritos de la tabla Tencent, no replicación independiente.123456789101112
  10. DataLearnerAI, Hy4 preview Benchmark Results Analysis, consultado el 31 de agosto de 2026.123456
  11. Hugging Face, tencent/Hy4-preview-FP8, consultado el 31 de agosto de 2026.
  12. Tencent, Hy3 preview launch, 24 de abril de 2026.
  13. OpenRouter, Tencent models, consultado el 31 de agosto de 2026.

¿Te ha resultado útil?

Recibe nuevos artículos por email

Un correo breve por cada nuevo artículo de la base de conocimiento. Sin spam, te das de baja con un clic.

Solo usamos tu email para enviar nuevos artículos. Sin compartir con terceros.

Volver a la base de conocimiento