A continuaciónSiguiente guía
Imbuir agentes de razonamiento
Empresas
GUÍA de empresas
DeepSeek es un laboratorio chino de inteligencia artificial cuyos modelos abiertos V3 y R1 sorprendieron a la industria al igualar el máximo rendimiento de razonamiento a una fracción del costo de capacitación.
R1 en particular demostró que se podía entrenar un razonamiento sólido paso a paso en gran medida mediante el aprendizaje por refuerzo.
DeepSeek-V3 es un gran modelo de lenguaje de mezcla de expertos con cientos de miles de millones de parámetros totales pero solo una pequeña fracción activa por token, lo que mantiene la inferencia barata. Lanzado a finales de 2024, su entrenamiento solo costó unos pocos millones de dólares, mucho menos que los modelos insignia occidentales. A principios de 2025, DeepSeek lanzó R1, un modelo de razonamiento construido sobre la base V3 que fue entrenado en gran medida con aprendizaje por refuerzo para producir un razonamiento de larga cadena de pensamiento antes de responder. R1 coincidió con los principales modelos de razonamiento en matemáticas y puntos de referencia de codificación y se lanzó como pesos abiertos bajo una licencia permisiva. La combinación de sólido desempeño, bajo costo y apertura desencadenó importantes reacciones en el mercado e intensificó el debate sobre la eficiencia, los modelos abiertos y la competencia global de la IA.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
El enfoque de peso abierto y de eficiencia primero de DeepSeek presiona a toda la industria a reducir costos y lanzar lanzamientos de manera más abierta. Espere modelos de seguimiento rápidos, una adopción más amplia de técnicas de MoE y RL por razonamiento, y una atención geopolítica continua a los laboratorios fronterizos chinos. La demostración de que el razonamiento puede surgir de forma económica a través del aprendizaje por refuerzo probablemente dará forma a la forma en que se construye y destila la próxima generación de modelos de razonamiento en versiones más pequeñas y desplegables.
Ejecutar un modelo de razonamiento abierto capaz localmente o en servidores privados para tareas matemáticas y de codificación sin pagar tarifas de API por token
Destilando la capacidad de razonamiento del R1 en modelos más pequeños que pueden ejecutarse en hardware modesto
Uso de R1 para resolver problemas matemáticos y de programación a nivel competitivo con un razonamiento visible paso a paso
Creación de aplicaciones sensibles a los costos en la base MoE V3, donde solo se activa una fracción de los parámetros por token para ahorrar computación
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
DeepSeek es un laboratorio chino de inteligencia artificial cuyos modelos abiertos V3 y R1 sorprendieron a la industria al igualar el máximo rendimiento de razonamiento a una fracción del costo de capacitación. R1 en particular demostró que se podía entrenar un razonamiento sólido paso a paso en gran medida mediante el aprendizaje por refuerzo.
V3 es un modelo de mezcla de expertos: tiene cientos de miles de millones de parámetros totales pero activa solo una pequeña fracción por token, lo que reduce el costo de cómputo.
R1 demostró que se podía entrenar un poderoso razonamiento en cadena de pensamiento principalmente mediante el aprendizaje por refuerzo, y se lanzó abiertamente, igualando a los mejores modelos a bajo costo.
Según se informa, entrenar el V3 costó sólo unos pocos millones de dólares, mucho menos que los modelos emblemáticos occidentales comparables, lo que conmocionó a la industria.
R1 fue recompensado por producir respuestas correctas y verificables, lo que lo llevó a desarrollar un largo razonamiento interno, autoevaluación y reflexión.
V3 introdujo técnicas como atención latente de múltiples cabezales y un esquema de equilibrio de carga auxiliar sin pérdidas para entrenar su MoE de manera eficiente.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Imbuir agentes de razonamiento
Empresas