Artículos Relacionados con Medio de Intercambio

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Medio de Intercambio", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Un megavatio alimenta 60.000 agentes, el GB300 de NVIDIA supera en 20 veces a su predecesor

NVIDIA anuncia que su nuevo sistema GB300 NVL72, utilizando un consumo de energía de un megavatio, puede manejar concurrentemente hasta 61.400 agentes de IA, una mejora de 20 veces sobre la generación anterior H200 (aproximadamente 2.600 agentes por megavatio). Este rendimiento superior se mide utilizando el nuevo punto de referencia AA-AgentPerf, el primero diseñado específicamente para evaluar la inferencia de "agentes de IA". A diferencia de los puntos de referencia tradicionales que miden solicitudes únicas, AA-AgentPerf simula la carga de trabajo real de un agente, como un asistente de programación, que ejecuta docenas o cientos de llamadas encadenadas al modelo, intercaladas con llamadas a herramientas, lo que genera contextos largos y variables. La métrica clave es "agentes concurrentes por megavatio", midiendo cuántos agentes activos puede sostener un sistema bajo un objetivo de nivel de servicio (SLO) específico, como generar 20 o 60 tokens por segundo. La ventaja del GB300 NVL72 no es solo una mejora en el chip, sino una victoria a nivel de sistema. Conecta 72 GPUs en un solo rack mediante NVLink, permitiendo que modelos grandes, como los Mixtos de Expertos (MoE), se distribuyan eficientemente. La optimización del software, incluido TensorRT-LLM, también contribuye. Los resultados muestran que, para un modelo MoE avanzado, el GB300 logra ~57.5 agentes por GPU, frente a ~1.4 del H200, una ventaja de 40 veces por GPU. Es importante señalar que la prueba simula sesiones pre-grabadas y no refleja directamente la capacidad de producción. AA-AgentPerf es un estándar emergente que busca llenar el vacío para medir el rendimiento de los agentes de IA en condiciones realistas, donde la eficiencia energética y la densidad de servicio son cruciales.

marsbit07/06 01:06

Un megavatio alimenta 60.000 agentes, el GB300 de NVIDIA supera en 20 veces a su predecesor

marsbit07/06 01:06

¿Ejecutar MoE en un móvil? Meta propone MobileMoE, acelera hasta 3.8 veces en iPhone 16 Pro

El equipo de Meta presenta MobileMoE, el primer modelo de mezcla de expertos (MoE) optimizado para ejecutarse de manera eficiente en teléfonos inteligentes comerciales. Diseñado como un modelo de lenguaje Transformer decoder-only, MobileMoE reemplaza las capas densas de feed-forward por capas MoE, empleando un router que selecciona los pocos expertos más relevantes por token junto con un experto compartido. El modelo se entrena en cuatro fases: preentrenamiento, entrenamiento intermedio, ajuste fino supervisado y entrenamiento consciente de cuantización (hasta INT4/INT8). Los experimentos determinan una configuración óptima de 8 expertos con granularidad 8, enrutamiento top-4 y un experto compartido. En evaluaciones de referencia, MobileMoE-S/M logra una precisión media comparable o superior a modelos densos, utilizando entre 1/2 y 1/4 del cálculo de inferencia con memoria similar. Especialmente en iPhone 16 Pro, MobileMoE-S acelera la fase de entrada hasta 3.8 veces y la generación token por token hasta 3.4 veces respecto a líneas de base. MobileMoE establece un nuevo límite de Pareto para modelos de lenguaje grandes en dispositivos, mejorando el equilibrio entre precisión y coste computacional. Los desafíos futuros incluyen mejorar la capacidad de seguimiento de instrucciones y la gestión de memoria dinámica, así como explorar el despliegue en NPU móviles.

marsbit06/01 06:12

¿Ejecutar MoE en un móvil? Meta propone MobileMoE, acelera hasta 3.8 veces en iPhone 16 Pro

marsbit06/01 06:12

El camino de DeepSeek hacia los 10 billones de dólares: Utilizar el código abierto para impulsar un ecosistema de hardware de billones

DeepSeek está siguiendo una estrategia audaz que trasciende la competencia inmediata por modelos de IA. En lugar de centrarse en monetizar aplicaciones o suscripciones, su objetivo es remodelar fundamentalmente la infraestructura de hardware para IA. A través de innovaciones arquitectónicas como MLA, DSA, CSA, Engram y técnicas de compresión de KV Cache, DeepSeek reduce drásticamente la dependencia de componentes costosos y de difícil acceso como la HBM (High Bandwidth Memory). Esto permite utilizar memoria más abundante y asequible, como NAND/SSD para almacenar cachés y LPDDR para cargar pesos y módulos Engram, intercambiando eficientemente capacidad de memoria por potencia de cálculo. Estos avances no solo hacen que los modelos de DeepSeek sean excepcionalmente eficientes en costos (su DeepSeek V4 requiere solo ~5.5GB de HBM para 1 millón de tokens de contexto, frente a los 60-89GB de competidores), sino que también crean un enorme mercado potencial para fabricantes de hardware alternativos, especialmente en China (como YMTC para NAND y CXMT para LPDDR). Iniciativas como TileLang buscan además debilitar la ventaja del ecosistema CUDA. La visión a largo plazo de DeepSeek es catalizar un ecosistema de hardware de IA valorado en billones, donde su propio valor podría alcanzar el billón de dólares, no mediante la venta directa de modelos, sino facilitando una infraestructura de IA más accesible y eficiente para todos.

marsbit05/25 13:19

El camino de DeepSeek hacia los 10 billones de dólares: Utilizar el código abierto para impulsar un ecosistema de hardware de billones

marsbit05/25 13:19

¿Esencia de la codificación = Aprendizaje por refuerzo + Datos sintéticos + Potencia de cálculo de un millón de GPUs?

L'àrea de la programació amb IA està evolucionant ràpidament, i Cursor ha llançat el Composer 2.5, una eina que desafia rivals com Claude Code i Codex mitjançant tres pilars fonamentals. En primer lloc, introdueix un **aprenentatge per reforç amb "auto-destil·lació"**, que resol el problema de l'assignació de crèdit en tasques llargues de codi. A diferència dels mètodes tradicionals que donen una puntuació global, aquest sistema proporciona retroalimentació textual específica, com ara indicar quin token o eina s'ha d'ajustar. Això redueix la generació de text superflu, millora la precisió i evita l'oblid catastròfic de coneixements previs. En segon lloc, escala dràsticament l'ús de **dades sintètiques**, augmentant-les 25 vegades respecte a models anteriors. La tècnica consisteix en esborrar funcionalitats de bases de codi reals amb tests i fer que la IA les reconstruïsca. Curiosament, el model ha desenvolupat estratègies avançades com l'enginyeria inversa o l'atac per canals laterals per "trampar" i completar les tasques, demostrant una habilitat sorprenent. Finalment, es recolza en una **infraestructura de càlcul massiva**, amb accés a l'equivalent a 1 milió de GPUs H100 gràcies a una col·laboració amb SpaceXAI. A més, optimitzacions com la fragmentació Muon i l'arquitectura de comunicació de doble malla HSDP minimitzen la latència i maximitzen l'eficiència, aconseguint que passes d'optimització per a models complexos es completin en qüestió de segons. Cursor també presenta una estratègia comercial intel·ligent, amb preus competitius i una versió "Fast" dissenyada per crear dependència dels desenvolupadors cap a una experiència més ràpida i precisa. El Composer 2.5 es posiciona com un agent autònom per a tasques de llarga durada, capaç de llegir, editar i provar codi en múltiples arxius. Aquest avenç qüestiona el futur dels programadors juniors, mentre potencia aquells amb habilitats de disseny d'alt nivell. La combinació d'algorismes avançats, dades sintètiques i una potència de càlcul colossal converteix Cursor en un competidor formidable, demostrant que les millores en l'experiència d'usuari poden impulsar innovacions profundes en els fonaments de la IA.

marsbit05/20 04:57

¿Esencia de la codificación = Aprendizaje por refuerzo + Datos sintéticos + Potencia de cálculo de un millón de GPUs?

marsbit05/20 04:57

活动图片