Artículos Relacionados con DeepSeek

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "DeepSeek", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Gu Yuxian, ganador del premio especial de Tsinghua, se une a DeepSeek

Recientemente, DeepSeek ha iniciado una intensa campaña de contratación. En paralelo, se ha observado que **Yuxian Gu**, doctorando de la Universidad de Tsinghua y ganador del Premio Especial para Estudiantes de Posgrado 2025, figura entre los autores del artículo de investigación de DeepSeek V4, lo que confirma su incorporación oficial a la empresa. Gu, quien también ha recibido becas de Apple y Ant Group, es doctorando en el Departamento de Ciencias de la Computación de Tsinghua, bajo la supervisión del profesor Minlie Huang. Su investigación se centra en mejorar la eficiencia a lo largo de todo el ciclo de vida de los grandes modelos de lenguaje (LLM), abarcando tres áreas principales: 1. **Selección de datos para preentrenamiento**: Desarrollo de teorías y algoritmos para optimizar la selección de datos, con trabajos representativos como PDS e Instruction Pre-training. 2. **Destilación de conocimiento en compresión de modelos**: Diseño de métodos para transferir conocimiento de modelos grandes a otros más pequeños y desplegables, siendo MiniLLM su trabajo más destacado. 3. **Arquitecturas de modelos eficientes**: Exploración de nuevos diseños arquitectónicos que reduzcan costes computacionales, como se demuestra en Jet-Nemotron. Con casi 5000 citas en Google Scholar y múltiples publicaciones como primer autor en conferencias de primer nivel (NeurIPS, ICLR, ACL), el trabajo de Gu ha tenido un impacto significativo. Su modelo Jet-Nemotron, por ejemplo, supera en rendimiento a otros modelos de atención completa de vanguardia con un notable aumento de eficiencia. Asimismo, su método de destilación MiniLLM ha sido adoptado por empresas líderes como Google y NVIDIA. Se espera que su incorporación a DeepSeek contribuya al desarrollo de nuevos avances en el campo de la IA.

marsbit07/06 02:10

Gu Yuxian, ganador del premio especial de Tsinghua, se une a DeepSeek

marsbit07/06 02:10

La nueva tecnología DeepSeek se adapta a los chips Apple, acelerando el modelo local en Mac un 60%

El proyecto de código abierto DSpark de DeepSeek, originalmente diseñado para acelerar modelos de lenguaje en GPUs de centros de datos, ha sido adaptado por el ingeniero Abdur Rahim para funcionar de forma nativa en chips Apple (mlx-dspark). Esta adaptación logra aceleraciones de aproximadamente 1.6x para Gemma-4 12B y 1.4x para Qwen3-4B en un Mac con M4 Pro, manteniendo una precisión de salida idéntica al modelo original (byte por byte), incluso con muestreo por temperatura. La clave de DSpark es el "decodificado especulativo": un modelo pequeño y rápido (draft) genera varios tokens candidatos que luego son verificados de manera eficiente por el modelo principal (target). Rahim optimizó este proceso para la arquitectura Apple Silicon, utilizando cuantización de 4 bits para el modelo draft (1.8 GB) y 8 bits para el target, logrando una tasa de aceptación del 82%. Posteriormente, el proyecto integró también DFlash, una técnica alternativa de decodificación especulativa que genera bloques de tokens en paralelo. DFlash mostró un rendimiento superior (hasta ~2.1x de aceleración) en tareas estructuradas como código y matemáticas, mientras que DSpark es más eficaz en conversaciones abiertas. La versión mlx-dspark v0.0.3 ahora permite elegir entre ambos métodos según la tarea. Este trabajo demuestra la viabilidad de ejecutar eficientemente LLMs avanzados localmente en hardware Apple, combinando velocidad y precisión.

marsbit07/03 12:25

La nueva tecnología DeepSeek se adapta a los chips Apple, acelerando el modelo local en Mac un 60%

marsbit07/03 12:25

¿Una corrección violenta del mercado de la IA, el momento Deepseek de Zhipu?

El martes, el mercado de valores relacionado con la inteligencia artificial experimentó una fuerte corrección. Las ventas comenzaron en Corea del Sur, donde Samsung Electronics y SK Hynix cayeron bruscamente, arrastrando al índice KOSPI y activando un mecanismo de suspensión temporal. La presión se extendió a Wall Street, afectando especialmente a acciones de semiconductores, memoria y almacenamiento en el Nasdaq y el S&P 500. Analistas vinculan la caída al lanzamiento del potente modelo de código abierto chino GLM-5.2 de智谱, un evento comparado con el impacto del modelo DeepSeek a principios de año. Surgen dudas sobre si los modelos abiertos más económicos pueden desafiar la supremacía de la IA estadounidense y poner en tela de juicio las enormes inversiones en centros de datos de las grandes tecnológicas. En Corea, la caída también se atribuyó a comentarios regulatorios sobre fondos cotizados (ETF) de acciones individuales apalancadas y a la decisión de MSCI de no incluir al país en su lista de observación para mercados desarrollados. La atención se centra ahora en los próximos resultados de Micron Technology como indicador de la salud del sector. Además, preocupa la creciente dependencia del financiamiento mediante deuda para la infraestructura de IA, ejemplificada por SpaceX. A pesar de la corrección, muchos expertos no creen que termine la tendencia de la IA. Ven esto como una reevaluación necesaria de las valoraciones, un ajuste tras una subida excesiva, más que como el fin de la historia. La pregunta clave ha pasado de ser si la IA crecerá a si el precio pagado por ese crecimiento es demasiado alto.

marsbit06/24 02:23

¿Una corrección violenta del mercado de la IA, el momento Deepseek de Zhipu?

marsbit06/24 02:23

智谱 ya es trillón de dólares, ¿lejos estará DeepSeek?

Recientemente, la empresa china de modelos básicos de IA Zhipu alcanzó una capitalización de mercado de 1,1 billones de HKD durante la sesión, un crecimiento anual del 1900%. Este hito sitúa a la empresa, con unos ingresos anuales de 724 millones de CNY, en el exclusivo "club del billón" de Hong Kong, junto a gigantes como Tencent y Alibaba. El catalizador inmediato de esta revalorización fue el lanzamiento de su modelo GLM-5.2, que posiciona a Zhipu como el "Anthropic chino" en la narrativa global de IA. Este rápido crecimiento ha avivado el debate sobre si se trata de un avance en la valoración de la IA china o de una burbuja especulativa. El caso de Zhipu refleja una tendencia más amplia: la revalorización de las empresas de modelos de IA chinas, tanto en el mercado primario (como DeepSeek, valorada en más de 50.000 millones de USD) como en el secundario (con MiniMax y otras aspirando a cotizar en Hong Kong). El mercado asume que el límite de valoración de la IA china aún puede expandirse, impulsado por la escasez de activos puros de IA y la agregación de capital en tecnología. Sin embargo, la presión es alta. Zhipu reportó una pérdida neta de 4.718 millones de CNY en 2025, con gastos en I+D que cuadruplicaron sus ingresos. La clave para sostener estas valoraciones radica en la capacidad comercial, como demuestra el referente global Anthropic, que se acerca a la rentabilidad. El próximo desafío para Zhipu y la industria es convertir la capacidad del modelo en un crecimiento de ingresos sostenible y, en última instancia, en flujo de caja. La respuesta a la pregunta sobre la burbuja dependerá de los resultados comerciales de las principales empresas de modelos chinos en su camino por igualar a los líderes mundiales.

marsbit06/22 23:28

智谱 ya es trillón de dólares, ¿lejos estará DeepSeek?

marsbit06/22 23:28

La historia de la financiación de DeepSeek

## Resumen del Financiamiento de DeepSeek A mediados de mayo, DeepSeek organizó una legendaria reunión de inversión de cuatro horas vía Tencent Meeting. Los participantes, en su mayoría sin haber conocido en persona al fundador Liang Wenfeng, quedaron profundamente impresionados por su filosofía. Liang enfatizó la búsqueda exclusiva de AGI (Inteligencia Artificial General), la importancia de la estabilidad del equipo por encima del capital, y una narrativa de "personas comunes logrando cosas extraordinarias" con extrema moderación. La ronda de financiamiento, iniciada en abril, ajustó sus términos iniciales: el monto mínimo por fondo se redujo de 5,000 a 1,500 millones de RMB, y se flexibilizó la estructura puramente en RMB, aunque se mantuvo una firme restricción contra la reventa de participaciones a LP extranjeros. La lista final de inversores, encabezada por Monolith Capital (que aumentó su compromiso a 3,000 millones de RMB), IDG Capital y Zhenxingu, generó sorpresa por la ausencia de gigantes como Sequoia China y Hillhouse. Se especula que razones regulatorias o relacionadas con sus LP pudieron influir. Un análisis más detallado revela que, tras una capa de fondos, participan indirectamente cerca de 100 instituciones e individuos, incluyendo capital estatal y corporativo. La principal condición de Liang Wenfeng para los inversores fue clara: no reclutar talento de DeepSeek. Más allá de los números, los inversores perciben en la compañía un profundo propósito, viéndola potencialmente como una futura empresa líder en el mercado bursátil chino. El proceso refleja la inesperada apertura de una empresa antes muy reservada, donde la convicción, el esfuerzo y la alineación filosófica fueron clave para obtener una participación.

marsbit06/18 02:12

La historia de la financiación de DeepSeek

marsbit06/18 02:12

La "orden del héroe" emitida por el Agente de WeChat, la mitad del mundo de Internet responde

WeChat AI pronto llegará, transformando la aplicación en una plataforma de agentes inteligentes capaz de gestionar tareas cotidianas. La plataforma ha publicado pautas para desarrolladores, permitiendo que los mini-programas se integren y puedan ser recomendados y utilizados por el AI de WeChat. Empresas como Meituan, Ctrip y Tongcheng ya han anunciado su integración. El agente, accesible deslizando la pantalla principal, puede entender instrucciones en lenguaje natural y utilizar mini-programas para realizar acciones como pedir comida o reservar restaurantes, creando un ciclo completo desde la decisión hasta la ejecución. Su potencia radica en su acceso privilegiado al ecosistema de WeChat: 1.432 millones de usuarios activos mensuales, cadenas sociales, historiales de chat, millones de mini-programas y WeChat Pay. Para desarrollarlo, Tencent utiliza un modelo de mundo llamado UI-Oceanus, que entrena al agente en un entorno simulado para predecir los resultados de las interacciones con los mini-programas. El proyecto se beneficia de las capacidades acumuladas por otros productos de IA de Tencent, como Yuanbao o WorkBuddy, a través de un mecanismo interno de Co-Design. Frente al enfoque GUI (que simula clics en pantalla y fue bloqueado por WeChat), Tencent apuesta por el protocolo A2A (Agent-to-Agent), que permite una colaboración controlada y autorizada con asistentes de otros fabricantes, como demostró el reciente acuerdo con Honor. Para manejar los enormes costes computacionales, Tencent busca aliados como DeepSeek, cuyo modelo eficiente en costes se ofrecerá en Tencent Cloud sin recargo. El objetivo final no es la exhibición técnica, sino resolver "buenos problemas" prácticos para los usuarios, convirtiendo a WeChat AI en la respuesta de Tencent para la segunda mitad de la era de la IA.

marsbit06/09 04:25

La "orden del héroe" emitida por el Agente de WeChat, la mitad del mundo de Internet responde

marsbit06/09 04:25

¿Podrá DeepSeek ahorrarle a China un billón de dólares?

El artículo analiza cómo DeepSeek podría generar un ahorro potencial de un billón de dólares en la infraestructura de IA de China, a través de optimizaciones técnicas que aumentan drásticamente la eficiencia del hardware. El punto de partida es el elevado costo de las plataformas de IA de última generación, como la futura Vera Rubin de Nvidia, donde una parte significativa del precio (unos 2 millones de dólares por sistema) corresponde a memoria costosa (HBM4, LPDDR5X), cuya precio ha aumentado un 435% en un año. Frente a esta tendencia, DeepSeek actúa en dirección opuesta. Sus modelos, especialmente la serie V4, aplican tres innovaciones clave para reducir la dependencia de los componentes de hardware más caros: 1. **Comprimir la "memoria" (contexto largo):** Su mecanismo de atención Multi-head Latent Attention (MLA) comprime radicalmente la caché KV (Key-Value Cache), reduciendo la necesidad de memoria de alta gama en hasta un 93% sin comprometer la calidad. 2. **Activar solo el "cuerpo" necesario:** Utiliza una arquitectura Mixture of Experts (MoE) extrema (ej., V4-Pro con 1.6 billones de parámetros totales pero solo 49 mil millones activos por token), permitiendo que solo una pequeña fracción de los parámetros del modelo resida en la costosa memoria HBM en cada momento. 3. **Reutilizar cálculos:** Almacena resultados intermedios (caché) para reutilizarlos en lugar de recalcular, ofreciendo precios muy bajos para las solicitudes que "aciertan en la caché". El efecto combinado es que el mismo hardware puede producir hasta 4 veces más tokens útiles, equivalente a reducir en un 75% la inversión en hardware para un rendimiento dado. Traducido a escala nacional, con un consumo diario de tokens que se proyecta en cientos o miles de billones, esta eficiencia podría evitar la construcción de decenas de miles de centros de computación inteligente, representando un ahorro acumulado del orden de un billón de dólares. Además, esta estrategia cambia el campo de batalla tecnológico: reduce la dependencia de los chips de computación más avanzados (donde China tiene desventaja) y traslada parte de la carga a la memoria y la ingeniería de sistemas, áreas donde la industria china (ej., CXMT) está ganando terreno. Así, DeepSeek no "elimina" la necesidad de hardware, sino que redefine radicalmente la ecuación de costos de la infraestructura de IA, haciendo la inteligencia artificial más accesible para las industrias chinas.

marsbit06/03 00:53

¿Podrá DeepSeek ahorrarle a China un billón de dólares?

marsbit06/03 00:53

El camino de DeepSeek hacia los 10 billones de dólares: Utilizar el código abierto para impulsar un ecosistema de hardware de billones

DeepSeek está siguiendo una estrategia audaz que trasciende la competencia inmediata por modelos de IA. En lugar de centrarse en monetizar aplicaciones o suscripciones, su objetivo es remodelar fundamentalmente la infraestructura de hardware para IA. A través de innovaciones arquitectónicas como MLA, DSA, CSA, Engram y técnicas de compresión de KV Cache, DeepSeek reduce drásticamente la dependencia de componentes costosos y de difícil acceso como la HBM (High Bandwidth Memory). Esto permite utilizar memoria más abundante y asequible, como NAND/SSD para almacenar cachés y LPDDR para cargar pesos y módulos Engram, intercambiando eficientemente capacidad de memoria por potencia de cálculo. Estos avances no solo hacen que los modelos de DeepSeek sean excepcionalmente eficientes en costos (su DeepSeek V4 requiere solo ~5.5GB de HBM para 1 millón de tokens de contexto, frente a los 60-89GB de competidores), sino que también crean un enorme mercado potencial para fabricantes de hardware alternativos, especialmente en China (como YMTC para NAND y CXMT para LPDDR). Iniciativas como TileLang buscan además debilitar la ventaja del ecosistema CUDA. La visión a largo plazo de DeepSeek es catalizar un ecosistema de hardware de IA valorado en billones, donde su propio valor podría alcanzar el billón de dólares, no mediante la venta directa de modelos, sino facilitando una infraestructura de IA más accesible y eficiente para todos.

marsbit05/25 13:19

El camino de DeepSeek hacia los 10 billones de dólares: Utilizar el código abierto para impulsar un ecosistema de hardware de billones

marsbit05/25 13:19

活动图片