ByteDance entrena un modelo de 10 billones de parámetros (y esa cifra dice menos de lo que parece)
La dueña de TikTok está entrenando el modelo de inteligencia artificial más grande que se conoce en China: hasta 10 billones de parámetros, es decir, diez millones de millones.
Lo adelantó el Financial Times el 7 de agosto citando a tres personas conocedoras del proyecto. Y antes de que la cifra te impresione, conviene entender qué significa exactamente. Spoiler: menos de lo que su tamaño sugiere.
Qué se sabe del proyecto
Según el resumen que hizo The Next Web de la información original, el modelo está en fase temprana de preentrenamiento, una etapa que suele durar entre tres y seis meses, a la que después hay que sumar el ajuste fino. Nadie va a poder usarlo a corto plazo.
Los puntos de referencia ayudan a dimensionarlo:
- Sería más de tres veces mayor que Kimi K3, de Moonshot AI, que ronda los 2,8 billones de parámetros y ya es de los mayores modelos chinos.
- Moonshot necesitó unos 20.000 chips de Nvidia para entrenar aquel modelo. La factura de ByteDance será considerablemente más alta.
- El objetivo declarado es plantar cara a Mythos, uno de los sistemas frontera occidentales que los laboratorios chinos aún no han igualado.
El fundador de la compañía, Zhang Yiming, ha pedido internamente que se evite apoyarse en la destilación de otros modelos para conseguir resultados rápidos. Traducido: quiere capacidad propia, no una copia barata.

Por qué el número de parámetros ya no te dice casi nada
Durante años, más parámetros equivalía a más capacidad. Esa correlación se ha roto, y el propio sector lo admite. Un modelo enorme mal entrenado rinde peor que uno mediano bien entrenado.
Hay tres razones concretas:
- La mayoría son modelos de mezcla de expertos. Qwen3.8-Max, de Alibaba, declara 2,4 billones de parámetros pero solo activa unos 95.000 millones en cada consulta. El parámetro «total» y el parámetro «que trabaja» no son lo mismo, y solo el segundo se refleja en tu factura.
- La calidad de los datos manda. Ese es el ingrediente que nadie publica y el que más diferencia hay entre laboratorios.
- Sin evaluaciones independientes, no hay dato. ByteDance ni siquiera ha confirmado públicamente el modelo. El recuento final de parámetros, además, se decidirá más adelante.
Toque Personal: cómo se traduce esto a tu empresa
Vas a ver esa cifra en titulares, en presentaciones comerciales y en el argumentario de quien te venda una integración. Y el reflejo natural es pensar «si es más grande, será mejor». No lo es necesariamente.
Lo que sí te afecta, y de forma bastante directa, es lo que hay detrás de esta carrera: cuanta más competencia haya en la frontera, más barato te sale usar IA. Lo estamos viendo semana tras semana, desde el recorte del 80% en el precio de GPT-5.6 Luna hasta DeepSeek quedándose a un punto del líder por un 60% menos. Que ByteDance se meta en el barro empuja esa tendencia, aunque su modelo tarde un año en salir.
Mi criterio práctico para elegir modelo, que no ha cambiado con este anuncio:
- Mide con tus propias tareas, no con la tabla de resultados del fabricante. Diez casos reales de tu negocio valen más que cualquier ranking.
- Calcula el coste por tarea terminada, no por millón de tokens. Un modelo barato que necesita tres intentos no es barato.
- Deja el proveedor desacoplado. El mercado se mueve tan rápido que atarte a uno solo por comodidad te va a salir caro este mismo año.
Si estás justo en ese punto de decidir qué modelo usar para cada cosa, en SimplificaconIA tienes una guía gratuita para elegir qué IA usar según la tarea que va por tipo de trabajo en lugar de por marca.
Conclusión
El titular es el tamaño. La noticia real es otra: los laboratorios chinos siguen apostando por escalar mientras Occidente discute si escalar todavía sirve. Uno de los dos bandos se va a equivocar, y el resultado se verá en los precios que pagues dentro de dieciocho meses.
¿Tú eliges modelo de IA por lo que promete la ficha técnica o por lo que te ha funcionado probándolo? Cuéntamelo en los comentarios.