Tendencias TecnológicasNoticias

Explora las últimas innovaciones, actualizaciones de protocolos, soluciones cross-chain y mecanismos de seguridad en el espacio blockchain. Ofrece una perspectiva enfocada en los desarrolladores para analizar las tendencias tecnológicas emergentes y los posibles avances.

Tras las notas de la IA, se esconde un "creador de exámenes" chino

Cada vez que se lanza un modelo de IA de vanguardia, la comunidad fija su atención en ciertas "hojas de resultados" familiares: MMLU-Pro, MMMU, MMMU-Pro. Estos puntos de referencia se han convertido en exámenes estándar para evaluar y comparar modelos como GPT, Claude, Gemini, Llama, Qwen y DeepSeek. Detrás de estas influyentes evaluaciones está el investigador chino Wenhu Chen, profesor asistente en la Universidad de Waterloo y fundador del TIGERLab (apodado "虎头帮"). Su trabajo surge de una necesidad crítica: a medida que los modelos avanzaban, las pruebas antiguas como MMLU se saturaban con puntuaciones casi perfectas, dejando de ser útiles para discernir diferencias reales. En 2024, Chen y su equipo presentaron MMLU-Pro, una renovación exhaustiva del original. Con 12,032 preguntas de 14 disciplinas, aumenta las opciones de respuesta de 4 a 10 para reducir las conjeturas e incorpora problemas más complejos que requieren razonamiento. El resultado fue una caída del 16% al 33% en la precisión de los modelos y una evaluación más estable y discriminatoria, rápidamente adoptada por la industria. Su contribución se extiende al ámbito multimodal con MMMU, un conjunto de 11,500 preguntas que combinan imágenes (gráficos, mapas, fórmulas) con conocimientos académicos para probar una comprensión integrada. Incluso los mejores modelos como GPT-4V inicialmente solo alcanzaron un 56% de precisión, revelando un largo camino por recorrer. Su sucesor, MMMU-Pro, cierra aún más las brechas, obligando a los modelos a utilizar la información visual y no solo el texto. La experiencia de Chen, que incluye investigación doctoral en preguntas complejas y una etapa en Google DeepMind trabajando en Gemini, le permite anticipar cómo los modelos pueden "aparentar" competencia. Su laboratorio no solo diseña evaluaciones, sino que también desarrolla modelos (como UniVideo para video o MoCha para avatares), asegurando que sus "exámenes" reflejen desafíos reales y los límites actuales de la tecnología. Actualmente, Chen continúa este trabajo en el laboratorio de superinteligencia de Meta, enfocado en datos y evaluación multimodal. Su historia destaca el papel fundamental, aunque a menudo menos visible, de los investigadores que construyen las herramientas para medir el verdadero progreso de la IA.

marsbit06/20 03:54

Tras las notas de la IA, se esconde un "creador de exámenes" chino

marsbit06/20 03:54

Apenas ahora, un ganador del Premio Nobel se convierte en nuevo empleado de Anthropic

El premio Nobel John Jumper, líder clave de AlphaFold, ha anunciado su salida de Google DeepMind tras casi 9 años para unirse a Anthropic. Este movimiento se produce apenas dos días después de que Noam Shazeer, coautor del famoso artículo 'Attention Is All You Need' y exdirector de Gemini, dejara Google por OpenAI, representando una pérdida significativa de talento para la compañía. Jumper, quien se doctoró en 2017, fue puesto al frente del equipo de AlphaFold poco después de unirse a DeepMind. Bajo su liderazgo, AlphaFold 2 resolvió en 2020 el problema del plegamiento de proteínas, un desafío de 50 años, y posteriormente generó estructuras para casi 200 millones de proteínas, multiplicando por 1000 el conocimiento anterior. En 2024, recibió el Premio Nobel de Química junto a Demis Hassabis. La partida de figuras como Jumper y Shazeer (este último reclutado por 2700 millones de dólares) plantea preguntas sobre la retención de talento en Google. Mientras tanto, Anthropic fortalece su apuesta en ciencias de la vida, tras adquirir la startup Coefficient Bio y desarrollar herramientas como Claude for Life Sciences. Este sector se ha convertido en un campo de batalla clave, con OpenAI lanzando GPT-Rosalind para biomedicina y Google DeepMind impulsando Isomorphic Labs. La contratación de Jumper marca un nuevo paso en esta carrera por revolucionar la biología con IA.

marsbit06/20 01:19

Apenas ahora, un ganador del Premio Nobel se convierte en nuevo empleado de Anthropic

marsbit06/20 01:19

Sin equipo de ventas y con ingresos de 20 millones de dólares, ¿cómo conquistó Viktor, el empleado de IA, a 30.000 empresas?

El asistente de IA Viktor, creado por un equipo con experiencia en DeepMind, ha logrado ingresos anuales de 20 millones de dólares sirviendo a 30,000 empresas, sin un equipo de ventas. Funciona como un "compañero de trabajo de IA de Nivel 3" que ejecuta tareas de principio a fin directamente en herramientas como Slack o Microsoft Teams mediante simples menciones (@). Permite a los usuarios realizar solicitudes en lenguaje natural, eliminando la necesidad de conocimientos en ingeniería de prompts. Su modelo de crecimiento impulsado por el producto (PLG) y facturación basada en créditos o consumo de tareas, en lugar de por usuario, facilita la adopción. Ofrece 100 dólares en créditos gratuitos para demostrar su valor rápidamente, como en procesos automatizados de conciliación nocturna o creación de presentaciones PPT. Viktor se integra con más de 3,200 aplicaciones y puede activarse automáticamente según horarios o eventos. También posee memoria organizacional, aprendiendo de correcciones para mejorar su ejecución. Al expandirse a Microsoft Teams, Viktor enfrenta nuevos desafíos de cumplimiento normativo y seguridad en grandes organizaciones. Su enfoque de ejecución autónoma, aunque eficiente, introduce riesgos de "caja negra" y posibles errores operativos. El éxito a gran escala dependerá de encontrar un equilibrio entre la automatización total, la gestión de riesgos y la construcción de confianza mediante un marco sólido de gobernanza, permisos y auditoría.

marsbit06/19 10:59

Sin equipo de ventas y con ingresos de 20 millones de dólares, ¿cómo conquistó Viktor, el empleado de IA, a 30.000 empresas?

marsbit06/19 10:59

Guía práctica de la tarjeta AI de WeChat: ¿Ha llegado la era de las compras con IA?

**Resumen: ¿Ha llegado la era de las compras con IA? Guía práctica de la Tarjeta AI de WeChat** El 17 de junio, WeChat Pay presentó oficialmente la "Tarjeta AI", una función que permite a los usuarios realizar pagos a través de su asistente de IA WorkBuddy. Sin embargo, las pruebas revelan que aún no permite el "consumo totalmente automático". **¿Qué es realmente?** No es una tarjeta que la IA use libremente. Es más bien una "subcartera" aislada de la principal de WeChat Pay. Los usuarios deben vincularla y transferir fondos específicamente a esta tarjeta. Cada pago iniciado por la IA requiere la confirmación manual del usuario en el móvil, y los gastos se gestionan por separado. **¿Cómo activarla?** El acceso está dentro de WorkBuddy. Preguntando "¿Cómo uso la tarjeta de pago AI de WeChat?", el agente proporciona un enlace para vincular la tarjeta escaneando un código QR con WeChat (válido por 5 minutos). Tras aceptar los términos, se puede recargar desde la cartera principal. **Escenarios objetivo actuales:** Según WeChat, es para comprar contenido pago (informes, datos), usar API/tools de pago, y suscribirse o renovar servicios. Sin embargo, en pruebas no se pudo activar fácilmente para estos casos específicos. **Prueba práctica: Pedir un té de burbujas (fallida):** Al pedir a WorkBuddy que compre un "Heytea", no puede hacerlo directamente. Requiere una "Skill" (habilidad) externa, como el "Asistente de Meituan". Solo generar el código QR para autorizar la cuenta de Meituan consumió 185.37 puntos (más que los 150 puntos diarios gratuitos). Tras la autorización, la IA generó un enlace de pago con la Tarjeta AI, pero el resultado fue la compra de un cupón de Meituan no deseado, no el té específico solicitado. **Conclusión: El problema no es el pago, sino la ejecución del agente.** La Tarjeta AI solo resuelve la capacidad de pago, no la compleja cadena de ejecución: comprender la necesidad precisa, elegir la plataforma correcta, autorizar la cuenta, seleccionar el producto exacto y gestionar el cumplimiento. Los agentes de IA actuales aún no ejecutan tareas del mundo real de manera fiable. **Mecanismo de seguridad actual:** El usuario mantiene el control final. La IA solo puede usar el saldo de la Tarjeta AI, cada pago necesita confirmación en el móvil, y la cuenta principal de WeChat Pay no se toca. **Recomendaciones:** Si quieres probarla, hazlo con cantidades pequeñas y en servicios digitales de bajo riesgo. Antes de pagar, verifica siempre el nombre del producto, el precio y los términos. No asumas que el Agente de IA ha entendido tu necesidad real, especialmente para pedidos físicos, entregas o cupones.

marsbit06/18 12:08

Guía práctica de la tarjeta AI de WeChat: ¿Ha llegado la era de las compras con IA?

marsbit06/18 12:08

El equipo de NVIDIA permite a un agente de programación hacerse cargo de experimentos con robots reales, logrando una tasa de éxito del 99%

La investigación en automatización ha dado un paso significativo al salir del entorno simulado y adentrarse en el mundo físico real. El equipo de NVIDIA GEAR, dirigido por Jim Fan, presentó el proyecto ENPIRE, un marco que permite por primera vez que agentes de programación autónomos realicen investigación en hardware robótico real. El sistema coloca ocho agentes Codex en una flota de robots con recursos de GPU y un presupuesto de tokens, asignándoles el objetivo de resolver tareas de forma eficiente y segura. Estos agentes operan con mínima intervención humana, manejando de forma autónoma un ciclo cerrado que incluye el reinicio automático de escenarios, la búsqueda en literatura, la implementación y entrenamiento de estrategias, la verificación y el análisis de registros para iterar continuamente. Han logrado una tasa de éxito del 99% en tareas de manipulación diestra como atar bridas, organizar clavos en una caja o instalar GPUs. Un hallazgo clave es que para muchas tareas robóticas, restablecer el entorno es más fácil que completar la tarea principal. Por ello, ENPIRE se centra primero en que los agentes creen procedimientos automáticos de reinicio. El sistema consta de cuatro módulos principales que forman el bucle de retroalimentación física: Entorno (EN), Mejora de Políticas (PI), Evaluación (Rollout, R) y Evolución (E). El proyecto también observó una "ley de escala física": aumentar el número de robots en paralelo (por ejemplo, a 8) acelera significativamente la resolución de tareas. Se introdujeron nuevas métricas como la Utilización Media del Robot (MRU) y la Utilización Media de Tokens (MTU) para medir la eficiencia. Actualmente, algunos sistemas pueden iterar durante toda la noche sin supervisión. El objetivo final es lograr una operación completamente autónoma. El proyecto ENPIRE será de código abierto, permitiendo a los desarrolladores replicar sistemas similares.

marsbit06/18 00:37

El equipo de NVIDIA permite a un agente de programación hacerse cargo de experimentos con robots reales, logrando una tasa de éxito del 99%

marsbit06/18 00:37

Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

Un pequeño modelo de 3B parámetros, VibeThinker-3B, desarrollado por el equipo de Sina Weibo, está generando revuelo al alcanzar un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos líderes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro, a pesar de su tamaño significativamente menor. Basado en Qwen2.5-Coder-3B, el modelo fue entrenado con un proceso "Spectrum-to-Signal" que incluye fine-tuning supervisado en dos etapas con aprendizaje curricular, aprendizaje por refuerzo aplicado a múltiples dominios (matemáticas, programación, razonamiento STEM) y destilación de conocimiento. También incorpora una estrategia de evaluación de confiabilidad "Claim-Level" (CLR) para mejorar aún más los resultados en benchmarks. Sus puntuaciones sobresalientes incluyen 94.3 en AIME26, 80.2 en LiveCodeBench v6 y una tasa de aprobación del 96.1% en competiciones recientes de LeetCode. Los autores proponen la "hipótesis de compresión paramétrica", sugiriendo que el razonamiento verificable es una capacidad altamente comprimible que puede alcanzar niveles de vanguardia en modelos pequeños cuando las tareas tienen una estructura clara y señales de feedback confiables, desacoplándose parcialmente del conocimiento factual que requiere más parámetros. El objetivo no es reemplazar a los modelos grandes, sino explorar los límites de los modelos pequeños en dominios específicos. El modelo está disponible públicamente, aunque su rendimiento es intencionalmente especializado y no sobresale en tareas que requieren conocimiento general o de mundo abierto.

marsbit06/18 00:26

Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

marsbit06/18 00:26

Cursor abandona la base de Kimi para su nuevo modelo de 1.5T, canjea 60.000 millones en acciones por Cursor, y el primer golpe de Musk apunta a GitHub de Microsoft

Hoy, Cursor anunció importantes novedades en la conferencia Compile: un nuevo modelo de más de 1.5 billones de parámetros y Origin, una plataforma Git nativa para agentes de IA. Esto ocurre poco después de que SpaceX confirmara su adquisición de Cursor mediante una transacción accionaria valorada en 60.000 millones de dólares, que se completará en el tercer trimestre de 2026. El nuevo modelo, entrenado desde cero con más de 100,000 GPUs y respaldado por los recursos computacionales de SpaceX, representa un aumento de 10 a 20 veces en capacidad de cálculo. Su objetivo es ir más allá de la codificación, buscando una inteligencia general más amplia para tareas de ingeniería. Cursor también presentó Origin, una plataforma de alojamiento de código diseñada específicamente para manejar la alta frecuencia de operaciones de los agentes de IA, incluyendo la resolución automática de conflictos de fusión, posicionándose como un competidor de GitHub. Fundada en 2023, Cursor ha crecido rápidamente en el campo de las herramientas de programación con IA. La adquisición por parte de SpaceX le proporciona una gran potencia de cálculo, mientras que SpaceX busca fortalecer su oferta de IA empresarial y su modelo Grok. La comunidad de desarrolladores observa con expectación si esta unión puede alterar el panorama actual del mercado.

marsbit06/17 10:32

Cursor abandona la base de Kimi para su nuevo modelo de 1.5T, canjea 60.000 millones en acciones por Cursor, y el primer golpe de Musk apunta a GitHub de Microsoft

marsbit06/17 10:32

Panorama del Ecosistema de Privacidad en Solana: La Pila Completa de Privacidad, desde el Cómputo hasta la IA

El ecosistema de privacidad de Solana se encuentra aún en etapas tempranas, pero está evolucionando hacia una pila completa que abarca desde la computación confidencial hasta la IA privada. Para lograr un ecosistema maduro, son elementos clave la verificación formal, la ausencia de comités, la inmutabilidad y el código abierto. En el ámbito de la computación privada, proyectos como Arcium (basado en MPC) y Magic Block (basado en TEE) ofrecen infraestructura para ejecutar cálculos sobre datos cifrados, con casos de uso en pagos, análisis de datos y sectores como la salud. Sobre esta base, se desarrollan aplicaciones para transferencias y balances privados. Umbra, construido sobre Arcium, introduce cuentas de token cifradas (ETAs) que ocultan montos, saldos y relaciones entre emisor y receptor. Otras billeteras como Privacy Cash y Hush utilizan grupos de mezcla (shielded pools) inspirados en Tornado Cash y Zcash, permitiendo transacciones privadas y hasta staking con ganancias de manera confidencial. Para eliminar el rastro en la cadena en actividades como trading, proyectos como encifherio y Vanish Trade enrutan intercambios a través de Jupiter o grupos de liquidez ocultos, protegiendo las estrategias de los usuarios frente a front-running y bots MEV. Darklake aporta infraestructura de liquidez nativa ZK y dark pools para perpétuas privadas. Los mercados de predicción privados, como Melee Markets, utilizan la infraestructura de Arcium para cifrar libros de ordenes, permitiendo a los participantes operar sin revelar su posición públicamente hasta la liquidación. Finalmente, la privacidad se extiende a la IA con proyectos como Loyal, que utiliza rollups temporales de Magic Block y computación cifrada de Arcium para crear agentes de IA en cadena que protegen las consultas, conversaciones y datos de los usuarios, otorgándoles propiedad y control sobre su información. El ecosistema avanza así hacia una pila de privacidad integral y componible en Solana.

marsbit06/17 04:41

Panorama del Ecosistema de Privacidad en Solana: La Pila Completa de Privacidad, desde el Cómputo hasta la IA

marsbit06/17 04:41

活动图片