El fin de lo grande: DeepSeek y la nueva era de la inteligencia artificial

El fin de lo grande: DeepSeek y la nueva era de la inteligencia artificial

Hay un momento en toda revolución tecnológica en el que uno se da cuenta de que, quizás, llevaba años haciendo la pregunta equivocada.

Durante los últimos cinco años, la pregunta parecía bastante sencilla:

¿Qué tan grande podemos hacer un modelo de inteligencia artificial?

Más parámetros. Más GPUs. Más datos. Más capacidad de cómputo. Centros de datos más grandes. Modelos más grandes.

La idea era casi intuitiva: si queremos máquinas más inteligentes, hagámoslas más grandes.

Pero quizás esa época está llegando a su límite.

Y lo interesante es que uno de los hombres que ayudó a construir esa era de la expansión ya nos estaba advirtiendo sobre ella.

Ilya Sutskever, uno de los fundadores de OpenAI y una de las figuras fundamentales de la inteligencia artificial moderna, abandonó OpenAI y creó Safe Superintelligence, SSI. En noviembre de 2025, conversando con Dwarkesh Patel, habló de la transición desde la "era del scaling", es decir, de hacer los modelos cada vez más grandes, hacia una "era de investigación". citeturn0search16

En aquel momento parecía una reflexión filosófica.

Hoy comienza a parecer una predicción de ingeniería.

El problema de hacer todo más grande

  • La lógica del scaling fue extraordinariamente poderosa.
  • Dale más parámetros a la red neuronal.
  • Dale más datos.
  • Dale más capacidad de procesamiento.
  • Y el modelo mejora.

Durante varios años funcionó extraordinariamente bien.

Y la industria construyó alrededor de esa idea una gigantesca máquina económica.

La ventaja competitiva empezó a ser el tamaño del centro de datos.

  • ¿Quién tenía más GPUs?
  • ¿Quién podía entrenar el modelo más grande?
  • ¿Quién podía gastar miles de millones de dólares en infraestructura?
  • ¿Quién tenía acceso a más datos?

Las respuestas a esas preguntas comenzaron a determinar quién podía construir la inteligencia artificial más poderosa.

Pero existe un problema bastante evidente.

La cantidad de información humana de alta calidad es finita.

Hay un número limitado de buenos libros, artículos científicos, páginas web, conversaciones, imágenes y programas de computadora.

No podemos duplicar indefinidamente el conocimiento humano útil.

En algún momento aparece una pared.

Y allí es donde el argumento de Sutskever comienza a adquirir importancia.

La próxima generación de inteligencia artificial quizás no dependa principalmente de hacer las máquinas más grandes.

Quizás dependa de hacerlas más inteligentes utilizando mejor lo que ya tienen.

Y entonces aparece DeepSeek

Esta semana, DeepSeek nos acaba de dar una demostración bastante espectacular de esa idea.

Su nuevo modelo V4.1-Flash tiene una arquitectura de 552 mil millones de parámetros.

Parece una barbaridad.

Pero aquí está lo interesante.

El modelo no utiliza todos esos parámetros para cada token.

Dependiendo de la operación, activa aproximadamente 8 mil millones de parámetros al procesar la entrada y 16 mil millones al generar la respuesta. citeturn0search10turn0search11

Piénsenlo un momento.

El modelo tiene un cerebro enorme, pero no despierta todo el cerebro cada vez que uno le hace una pregunta.

Utiliza selectivamente aquello que necesita.

Y esto no significa simplemente construir un modelo más pequeño.

Es una manera diferente de pensar el cómputo.

Y aquí aparece una analogía que me resulta fascinante.

Nosotros tampoco utilizamos nuestro cerebro completo para resolver cada problema.

Cuando estamos leyendo, conduciendo, recordando una experiencia o resolviendo una ecuación, diferentes circuitos neuronales participan en función de la tarea.

La inteligencia no está solamente en el número de neuronas.

Está también en cómo las utilizamos.

Y esa diferencia puede convertirse en una de las ideas más importantes de la inteligencia artificial durante los próximos diez años.

Más pequeño no significa necesariamente menos inteligente

Hay otro detalle que me parece particularmente revelador.

DeepSeek afirma que V4.1-Flash supera a su modelo mucho más grande, V4-Pro, en varias tareas relacionadas con agentes de inteligencia artificial.

Por ejemplo, en DeepSWE v1.1 obtuvo 74.2 frente a 62.7 del V4-Pro. citeturn0search15turn0search18

Y aquí hay algo importante.

No estamos hablando solamente de un benchmark académico diseñado para medir una habilidad muy específica.

Estas evaluaciones intentan acercarse cada vez más a una pregunta mucho más práctica:

¿Puede la inteligencia artificial hacer algo útil?

  • ¿Puede escribir código?
  • ¿Puede utilizar herramientas?
  • ¿Puede resolver tareas complejas?
  • ¿Puede mantener un contexto largo?
  • ¿Puede funcionar como un agente y no simplemente producir un párrafo muy elegante?

Para mí, esa es una pregunta mucho más interesante.

Porque al final nosotros no vamos a pagarle a una inteligencia artificial porque nos diga lo inteligente que es.

Vamos a pagarle porque hace cosas.

Y DeepSeek hizo algo todavía más interesante

El 14 de septiembre ocurrió algo que merece atención.

DeepSeek comenzó a redirigir las solicitudes dirigidas a V4-Pro hacia V4.1-Flash, mientras prepara la próxima versión Pro.

Es decir, en términos prácticos, la empresa está diciendo:

"¿Para qué utilizar el modelo más grande si el pequeño está haciendo mejor el trabajo que realmente importa?" citeturn0search10turn0search11

Esto es extraordinario.

Imaginen que una empresa de procesadores anunciara que su chip de bajo consumo supera al procesador insignia en las tareas que realmente realizan los usuarios y, por lo tanto, va a retirar progresivamente el procesador más grande.

Todo el mundo prestaría atención.

Y deberíamos hacerlo también en inteligencia artificial.

Porque quizás la competencia ya no sea:

¿Quién tiene el modelo más grande?

Quizás la pregunta sea:

¿Quién produce más inteligencia por dólar, por watt, por GPU y por segundo?

Y esa es una carrera completamente diferente.

La economía de la inteligencia

Esto es importante porque la inteligencia artificial es, finalmente, una tecnología económica.

Un modelo que es 10% más inteligente pero cuesta diez veces más operar puede no ser el ganador.

En cambio, un modelo ligeramente menos impresionante en determinados benchmarks, pero que cuesta una fracción, puede ejecutarse miles de veces simultáneamente y completar tareas de manera confiable, podría tener muchísimo más valor económico.

Por eso las decisiones arquitectónicas de DeepSeek son importantes.

La empresa afirma que V4.1-Flash reduce considerablemente las necesidades de memoria de su KV cache: aproximadamente a una cuarta parte de la memoria HBM y a una octava parte del almacenamiento SSD respecto a la generación anterior. citeturn0search10

Esto puede sonar como un detalle para ingenieros.

No lo es.

Eso se convierte directamente en costos de infraestructura.

Y los costos de infraestructura determinan quién puede desplegar inteligencia artificial a gran escala.

Entonces, ¿qué es realmente lo que está cambiando?

Yo no creo que esto signifique que los modelos grandes hayan muerto.

Sería otra exageración tecnológica.

De hecho, DeepSeek todavía tiene un V4-Pro con 1.6 trillones de parámetros totales y 49 mil millones activos. citeturn0search12

La conclusión es otra.

El tamaño dejó de ser la única medida del progreso.

Estamos entrando en una etapa en la que la arquitectura, los métodos de entrenamiento, el reinforcement learning, la administración de memoria, el routing, el razonamiento y la eficiencia de inferencia pueden ser tan importantes —y en determinados casos más importantes— que el número bruto de parámetros.

Y esto cambia completamente la filosofía del desarrollo de la inteligencia artificial.

  • Durante cinco años la metáfora fue la fábrica.
  • Construyamos una fábrica más grande.
  • Compremos más máquinas.
  • Entrenemos un modelo más grande.

Ahora la metáfora comienza a parecerse más al cerebro.

No se trata simplemente de tener más neuronas.

Se trata de aprender a utilizarlas mejor.

Y aquí regreso a Ilya Sutskever

Cuando Sutskever dijo que estábamos pasando de la era del scaling a la era de la investigación, yo no creo que estuviera diciendo que el scaling iba a desaparecer de repente.

Su argumento era mucho más interesante.

Los beneficios fáciles estaban comenzando a desaparecer.

Los próximos avances requerirían comprensión.

Comprender cómo generalizan los modelos.

  • Cómo razonan.
  • Cómo aprenden.
  • Cómo utilizan herramientas.
  • Cómo interactúan con el mundo.
  • Cómo aprenden de su propia experiencia.

Cómo podemos hacerlos más capaces sin simplemente lanzar otras mil GPUs al problema.

Eso es investigación.

Y quizás eso sea exactamente la transición que estamos comenzando a observar.

Tal vez hemos llegado al momento en que la inteligencia se convierte en un problema de ingeniería

Durante buena parte de la historia de la computación, nuestra obsesión fue hacer las máquinas más rápidas.

Después aprendimos a hacerlas más pequeñas.

Y luego aprendimos a hacerlas más eficientes.

La inteligencia artificial puede estar siguiendo una trayectoria similar.

Primero vino la escala.

Ahora viene la eficiencia.

Y después de la eficiencia viene algo todavía más interesante:

la coordinación.

En lugar de preguntarnos únicamente qué tan grande puede ser un modelo, comenzaremos a preguntarnos cuántos modelos especializados pueden trabajar juntos, cómo pueden utilizar herramientas, cómo pueden aprender de la retroalimentación y cómo podemos asignar inteligentemente el cómputo.

Eso es un futuro muy diferente.

Y, francamente, me parece mucho más interesante.

Porque si la inteligencia deja de depender exclusivamente de gigantescos centros de datos y comienza a depender cada vez más de mejores algoritmos, mejores arquitecturas y mejor investigación, la revolución de la inteligencia artificial puede hacerse accesible a mucha más gente.

Y eso es exactamente lo que ocurrió con la computadora personal y posteriormente con Internet.

La tecnología se democratiza.

Y quizás esa sea la verdadera noticia detrás de DeepSeek V4.1-Flash.

No que DeepSeek haya construido un modelo más pequeño.

Sino que quizá nos esté mostrando algo mucho más importante:

**el futuro de la inteligencia artificial no necesariamente consiste en construir cerebros más grandes.

Puede consistir en construir cerebros más inteligentes.**

Dr. Jose A. Cisneros, MD,PhD

Comparte este artículo

WhatsApp Telegram Facebook X LinkedIn Email