El 28 de agosto de 2026 Tencent publicó y abrió Hy4 preview, su nuevo modelo flagship Mixture-of-Experts de la familia Tencent Hy, antes más conocida como Hunyuan.[1][6]
Especificación principal:
770B parámetros totales
49B parámetros activos por token
78 capas
256 routed experts + 1 shared expert
top-8 routed experts activos por token
contexto 1M
Apache License 2.0
Tencent publicó los pesos completos y Hy4 preview-FP8. El repositorio completo en Hugging Face ocupa aproximadamente 1,56 TB.[2][3]
El modelo está orientado a software engineering, trabajo de oficina, análisis financiero, game development, investigación científica y agentes con herramientas.[1][2]
Tres puntos importan especialmente.
Primero, los pesos están bajo Apache 2.0, lo que permite self-hosting y uso comercial sujeto a la licencia.[2][4]
Segundo, Tencent reporta resultados altos en coding y agents: 82,9% en SWE-bench Multilingual, 85,4% en Terminal-Bench 2.1 y 83,7% en MCP-Atlas.[2][9]
Tercero, Tencent afirma que Hy4 participó en la optimización de su propio proceso de desarrollo e infraestructura de inference. Una de esas iteraciones aumentó el throughput end-to-end un 31,8% frente al baseline interno de Tencent.[1]
Eso no significa que Hy4 se haya entrenado de manera totalmente autónoma. La empresa describe una etapa temprana de recursive self-improvement aplicada al proceso de ingeniería.
Estado de la información: 31 de agosto de 2026.
TL;DR
| Pregunta | Respuesta verificada |
|---|---|
| Modelo | Tencent Hy4 preview |
| Lanzamiento | 28 de agosto de 2026 |
| Tipo | Mixture-of-Experts |
| Parámetros totales | 770B |
| Parámetros activos | 49B por token |
| Capas | 78 |
| Routed experts | 256 |
| Shared experts | 1 |
| Routed experts activos | top-8 |
| Contexto | 1M en model card, 1.048.576 en OpenRouter |
| Max output OpenRouter | 64K |
| Attention | Gated DeepSeek Sparse Attention |
| Optimización sparse attention | IndexCache |
| MTP | 1 capa nativa, 10B total / 0,7B activos |
| Licencia | Apache 2.0 |
| Pesos completos | aprox. 1,56 TB |
| Variante cuantizada | Hy4 preview-FP8 |
| Self-hosting | vLLM y SGLang |
| Recipe oficial | tensor parallel size 8 |
| API input | $0.834 / 1M tokens |
| API output | $2.501 / 1M tokens |
| Cache hit | $0.042 / 1M tokens |
| SWE-bench Multilingual | 82,9%, Tencent-reported |
| SWE-bench Pro | 65,7%, Tencent-reported |
| Terminal-Bench 2.1 | 85,4%, Tencent-reported |
| GPQA Diamond | 92,3%, Tencent-reported |
| MCP-Atlas | 83,7%, Tencent-reported |
| Estado | Preview |
| Limitaciones | reasoning demasiado largo y over-verification |
| Caveat principal | sin replicación independiente amplia de toda la tabla de lanzamiento |
¿Qué publicó Tencent?
Tencent puso a disposición:
Hy4 preview
Hy4 preview-FP8
en Hugging Face, ModelScope, GitCode y CNB.[2]
También está disponible vía WorkBuddy, CodeBuddy, Tencent Cloud TokenHub y OpenRouter.[1][7]
Reuters confirmó el lanzamiento del 28 de agosto y los usos anunciados en software engineering, research y financial analysis.[6]
770B no significa 770B activos por token
Hy4 utiliza Mixture-of-Experts.
El backbone tiene:
770B total
pero activa aproximadamente:
49B
por token.[2]
Eso equivale a cerca del 6,4% del backbone.
MoE reduce el cálculo activo por token, pero no elimina la necesidad de almacenar y distribuir un modelo enorme.
Organización de expertos
El backbone tiene 78 capas.[2]
La primera usa un FFN dense.
Las otras 77 contienen:
256 routed experts
1 shared expert
Por token se activan:
top-8 routed experts
+
shared expert
Hy4 vs Hy3: gran salto de escala
Hy3:
295B total
21B active
256K context
Hy4 preview:
770B total
49B active
1M context
Es aproximadamente:
- 2,61× más parámetros totales,
- 2,33× más parámetros activos,
- al menos 3,9× más contexto declarado.
Tencent dice que amplió a la vez tamaño, contexto, datos de entrenamiento y post-training.[2]
Contexto de 1M tokens
La model card indica:
Context Length: 1M
OpenRouter expone:
1,048,576 tokens
64,000 max completion tokens
Es útil para codebases grandes, sesiones largas de agentes, análisis multi-documento y research.
Pero contexto máximo y calidad efectiva de recuperación no son equivalentes.
Gated DeepSeek Sparse Attention
Hy4 usa Gated DeepSeek Sparse Attention.[2]
Sparse attention intenta reducir el coste de secuencias largas seleccionando posiciones relevantes en lugar de aplicar full quadratic attention en todos los puntos.
Tencent lo combina con:
IndexCache
¿Qué hace IndexCache?
IndexCache reutiliza sparse indices entre capas.[8]
El paper muestra que, en los modelos DSA evaluados, puede reducir trabajo del indexer y acelerar prefill/decode con impacto pequeño en calidad.[8]
Esos resultados pertenecen al trabajo de IndexCache, no a una medición directa de Hy4.
Capa MTP nativa
Además del backbone, Hy4 incluye una capa Multi-Token Prediction.[2]
Tencent especifica:
10B total
0.7B activos
Se utiliza para speculative decoding y aparece habilitada en los recipes oficiales de vLLM y SGLang.[2]
Los pesos son realmente públicos
Hugging Face muestra:
tencent/Hy4-preview
1.56 TB
131 shards safetensors
Apache-2.0
También existe:
tencent/Hy4-preview-FP8
Esto permite self-hosting, fine-tuning, análisis y stacks propios de inference.
Apache 2.0
La model card y el repositorio oficial indican:
Apache License 2.0
Es una licencia permisiva que admite uso, modificación y distribución, también comercial, bajo sus condiciones.
Self-hosting oficial
Tencent recomienda:
vLLM
SGLang
El recipe vLLM usa:
vllm/vllm-openai:hy4-preview
y:
--tensor-parallel-size 8
SGLang usa --tp-size 8.
Eso no significa que ocho GPU cualquiera sean suficientes. Memoria, precision, KV cache, contexto y concurrency importan.
API compatible con OpenAI
Tras desplegarlo con vLLM/SGLang se puede llamar mediante endpoint compatible con OpenAI.[2]
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "Review this repository architecture."}],
temperature=0.9,
top_p=1.0,
)
Tencent recomienda temperature=0.9 y top_p=1.0.[2]
Se puede reducir el reasoning
Por defecto, Hy4 usa un nivel alto de reasoning para tareas difíciles.[2]
Para respuestas más directas:
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "no_think"
}
}
Es relevante porque el reasoning excesivamente largo es una limitación oficial.
Limitaciones oficiales de preview
- puede dedicar más tiempo del necesario a tareas complejas,
- tiende a over-verify su propio trabajo.
En agentes esto puede aumentar tool calls, latency y coste.
Benchmarks: caveat primero
Tencent publicó un benchmark appendix en la model card.[2]
A 31 de agosto todavía no existe una replicación independiente amplia y con configuración idéntica de toda la tabla.
Por ello marcamos los resultados como:
Tencent-reported
Resultados seleccionados
Transcripción de la tabla de Tencent:[2][9][10]
| Benchmark | Hy4 preview |
|---|---|
| GPQA Diamond | 92,3% |
| Terminal-Bench 2.1 | 85,4% |
| MCP-Atlas | 83,7% |
| SWE-bench Multilingual | 82,9% |
| MathArena Apex 2025 | 74,2% |
| SWE-bench Pro | 65,7% |
| DeepSWE | 64,3% |
| HLE, High + Tools | 55,4% |
| HLE, High sin tools | 43,4% |
Todos son vendor-reported.
SWE-bench Multilingual: 82,9%
Tencent reporta:
Hy4 preview: 82.9%
Hy3: 75.8%
Son +7,1 puntos.
Para compararlo con otros resultados hay que verificar variante de benchmark y harness.
SWE-bench Pro: 65,7%
Tencent reporta:
Hy4 preview: 65.7%
Hy3: 57.9%
Son +7,8 puntos y una señal clara de mejora en software engineering.
DeepSWE: salto generacional
La transcripción indica:
Hy3: 28.0%
Hy4 preview: 64.3%
Precisamente por el tamaño del salto, la replicación independiente es especialmente importante.
Terminal-Bench 2.1: 85,4%
Tencent reporta:
Hy4 preview: 85.4%
Es muy fuerte para coding agents, pero el mismo chart muestra competidores con valores comparables o superiores. No demuestra una victoria universal.
GPQA Diamond: 92,3%
Resultado Tencent-reported:
92.3%
Apoya el posicionamiento en scientific reasoning.[1]
No garantiza fiabilidad en investigación real.
MCP-Atlas y agentes con tools
Tencent reporta:
MCP-Atlas: 83.7%
OpenRouter confirma soporte de tools, tool_choice y structured outputs con JSON Schema.[7]
Hy4 vs Kimi K3 y GLM-5.3: blind test interno
163 expertos Tencent
203 tareas de ingeniería
escala 0–4
Promedios:
Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92
Contra Kimi K3:
51.2% wins
7.9% ties
40.9% losses
Contra GLM-5.3:
46.8% wins
12.8% ties
40.4% losses
Es una ventaja pequeña en un workload interno de Tencent, no prueba universal.
Claude Opus 5 y GPT-5.6 Sol
Tencent también los incluye en su benchmark appendix.[9]
SWE-bench Multilingual:
Hy4 preview: 82.9%
Claude Opus 5: 89.5 / 85.8%
GPT-5.6 Sol: 74.1%
Terminal-Bench 2.1:
Hy4 preview: 85.4%
Claude Opus 5: 86.7 / 85.4%
GPT-5.6 Sol: 88.8 / 88.3%
Los valores dobles representan configuraciones/variantes del chart de Tencent y no deben mezclarse en un ranking único.
Precio API
Tencent publica:[1]
Input: $0.834 / 1M tokens
Output: $2.501 / 1M tokens
Cache hit: $0.042 / 1M tokens
OpenRouter muestra las mismas tarifas.[7][13]
Precio por token no es coste por tarea. Reasoning largo y más tool calls pueden cambiar la economía real.
Self-hosting vs API
API
Adecuada para adopción rápida, demanda variable y cuando no se quiere operar un cluster GPU grande.
Self-hosting
Útil para data residency, control de inference y workloads grandes/estables.
Con alrededor de 1,56 TB de pesos completos, no es un modelo típico de una sola workstation.[3]
¿Hy4 se “optimizó a sí mismo”?
Tencent dice que participó en optimización automática de training methods, data strategies, evaluation frameworks y low-level operators.[1]
Proponía enfoques, ejecutaba experimentos e iteraba usando resultados.
Tencent lo llama:
early-stage recursive self-improvement loop
No equivale a decir que el modelo se entrenó solo.
¿Qué significa +31,8% throughput?
Tencent afirma que Hy4 analizó bottlenecks e iteró sobre operator fusion y communication optimization.[1]
Resultado:
+31.8% end-to-end throughput
vs baseline interno Tencent
No significa 31,8% más rápido que Kimi, Claude o GPT.
Ventajas principales
- Apache 2.0.
- Contexto 1M.
- 49B activos de 770B total.
- Buen perfil coding/agent según Tencent.
- Recipes oficiales vLLM/SGLang.
- FP8.
- Precio API competitivo.
Riesgos e incógnitas
- Preview.
- Benchmarks mayoritariamente vendor-reported.
- Over-reasoning.
- Over-verification.
- Gran infraestructura para self-hosting.
- Calidad real del contexto 1M por validar.
- Data governance depende del provider cuando se usa API.
¿Cómo debería benchmarkearlo una empresa?
Comparar con tareas idénticas:
Hy4 preview
Kimi K3
GLM-5.3
DeepSeek V4
Claude Opus 5
GPT-5.6 Sol
Medir:
- task completion,
- test pass rate,
- calidad del diff,
- tool calls,
- retries,
- tokens,
- latency,
- coste por tarea,
- regresiones,
- cambios fuera de scope,
- long-context quality.
Métrica clave:
cost per successful task
Checklist de deployment
Calidad
- Probar tareas internas.
- Separar benchmarks Tencent de resultados independientes.
- Comparar high reasoning y
no_think. - Medir over-verification.
- Probar alucinaciones.
- Validar tool calling.
- Validar structured outputs.
- Probar sesiones largas de agentes.
Long context
- Probar 32K, 128K, 256K y más.
- Medir retrieval accuracy.
- Medir time-to-first-token.
- Medir KV-cache footprint.
- No asumir que 1M context = 1M memoria perfecta.
- Probar repo-level coding.
- Probar cross-document reasoning.
- Probar prompt injection en contexto largo.
Self-hosting
- Verificar requisitos GPU.
- Empezar con FP8 oficial.
- Probar vLLM.
- Probar SGLang.
- Medir throughput con concurrency real.
- Medir P50/P95/P99.
- Planificar storage.
- Revisar Apache 2.0 con legal.
API
- Verificar precio actual.
- Revisar cache semantics y TTL.
- Revisar data retention.
- Revisar región.
- Definir límites de coste.
- Monitorizar uso por agente.
- Mantener fallback model.
- Medir cost per successful task.
¿Vale la pena migrar desde Hy3?
Para usuarios de Hy3, Hy4 merece un POC.
Sobre el papel:
295B → 770B total
21B → 49B active
256K → 1M context
más grandes mejoras vendor-reported en coding y agents.[2][5][9]
Pero Hy4 puede razonar más tiempo, necesita más infraestructura y sigue siendo preview.
Veredicto POLPROG
Hy4 preview es uno de los lanzamientos open-weight más importantes de finales de agosto de 2026.
Lo relevante es la combinación:
770B total
49B active
1M context
Apache 2.0
FP8
vLLM + SGLang
precio API agresivo
perfil coding/agent fuerte
Hay que separar tres niveles de evidencia.
Hechos técnicos
Arquitectura, licencia, pesos, contexto, deployment y precio están bien documentados.[1][2][3][7]
Benchmarks
Son fuertes, pero al lanzamiento siguen siendo principalmente Tencent-reported.[2][9][10]
Self-improvement
Forma parte del proceso R&D descrito, pero no es self-training totalmente autónomo.[1]
Conclusión razonable al 31 de agosto:
Hy4 preview debe estar en la shortlist para coding agents, research agents, workflows long-context e infraestructura AI self-hosted.
Todavía no hay base para decir:
Hy4 es el mejor modelo del mundo.
Sí hay base para decir:
Tencent ha colocado Hy4 en el pequeño grupo de modelos open-weight que ya no se pueden ignorar al diseñar un stack AI de producción.

