Artículos Relacionados con LLM

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "LLM", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

El Mundial apenas lleva unos días, ya hay modelos de IA que se consagran y otros que se estrellan en las predicciones

La Copa Mundial apenas ha comenzado, pero los modelos de IA ya están en el centro de atención por sus predicciones, con algunos destacando y otros fallando estrepitosamente. Con el auge de los mercados de predicción, los usuarios ahora apuestan con dinero real sobre resultados, marcadores y eventos específicos como tarjetas rojas. En este contexto, varios modelos de IA, como Qwen, ChatGPT, Gemini, Claude, DeepSeek y Copilot, se utilizan como una referencia más para el análisis previo al partido. Tras los primeros encuentros, algunos modelos han mostrado aciertos notables. Qwen predijo correctamente el 2-0 de México sobre Sudáfrica en el partido inaugural, incluso mencionando el riesgo de tarjetas rojas para Sudáfrica, y también acertó el 2-1 de Corea del Sur ante República Checa. Copilot, por su parte, acertó el mismo 2-0 en el partido inaugural, el 2-1 de Corea del Sur y sorprendió al predecir el empate 1-1 entre Brasil y Marruecos. Sin embargo, también ha habido fallos significativos. Copilot erró en varios partidos como Canadá vs. Bosnia (predijo 2-1, acabó 1-1) y en sorpresas como la victoria 2-0 de Australia sobre Turquía. ChatGPT, aunque ofrece análisis detallados y acertó en el partido inaugural, ha mostrado dificultades para prever partidos ajustados o sorpresas, tendiendo a favorecer a los equipos teóricamente más fuertes. Otros modelos como Gemini, Grok y Claude han mostrado resultados variados en pruebas puntuales, pero aún no hay suficientes datos para evaluarlos completamente. En resumen, mientras que la IA ya sirve como una herramienta de consulta en las apuestas, está lejos de ser infalible. Algunos modelos han tenido inicios brillantes, pero su consistencia a largo plazo está por verse. Se necesitarán más partidos para determinar qué modelos realmente "entienden" el fútbol.

Odaily星球日报06/15 08:54

El Mundial apenas lleva unos días, ya hay modelos de IA que se consagran y otros que se estrellan en las predicciones

Odaily星球日报06/15 08:54

En solo 5 segundos y con una conversación: ¿El 'mecanismo de seguridad más fuerte' de Claude Fable 5 ha sido vulnerado por un equipo de investigadores chinos?

En 5 segundos y con una sola conversación, un equipo internacional liderado por investigadores chinos ha vulnerado los mecanismos de seguridad del modelo Fable 5 de Anthropic. Este modelo, de alto nivel ("Mythos"), incorpora un nuevo clasificador de seguridad para bloquear solicitudes de riesgo en áreas como ciberseguridad o biología. Ataques tradicionales como inyección de prompts o role-play habían fracasado. El equipo, dirigido por Yutao Wu de la Universidad Deakin, explotó un fenómeno denominado "Colapso Interno de Seguridad" (ISC), descrito en su investigación de marzo. El ataque no utiliza prompts maliciosos externos, sino que aprovecha un fallo estructural en la arquitectura común de "clasificador + modelo". Cuando un agente de IA ejecuta tareas complejas y de múltiples pasos (como completar datos faltantes para que un script funcione), puede internalizar un contexto donde genera contenido riesgoso para cumplir con el objetivo, sin que el clasificador inicial lo detecte. El método TVD (Tarea, Validador, Datos) demuestra este riesgo: con una tarea profesional legítima, datos incompletos y un validador que solo verifica formato/completitud, el agente puede autocompletar información peligrosa (ej., en bioquímica o seguridad) para que la tarea "pase la validación". El flujo de tráfico confirmó que la salida dañina provenía directamente de Fable 5, no del modelo de respaldo Opus 4.8. La vulnerabilidad no es específica de Fable 5. El benchmark ISC-Bench, con 84 plantillas en 9 áreas, ha probado más de 60 modelos líderes (incluidos modelos de Apple para móviles), mostrando tasas de éxito significativas. El trabajo subraya que los clasificadores de seguridad estáticos en la frontera del sistema son insuficientes para riesgos que emergen internamente durante la ejecución autónoma de agentes en flujos de trabajo largos. El equipo avanza en la construcción de infraestructuras de seguridad más robustas para la próxima generación de sistemas de IA.

marsbit06/15 03:21

En solo 5 segundos y con una conversación: ¿El 'mecanismo de seguridad más fuerte' de Claude Fable 5 ha sido vulnerado por un equipo de investigadores chinos?

marsbit06/15 03:21

Tiemblen humanos, la IA sigue acelerando a toda velocidad

Sí, la IA sigue avanzando a toda velocidad. Aunque algunos creían que la Ley de Escalado (Scaling Law) podría estar tocando techo, expertos en la conferencia BAAI 2026 señalaron que está lejos de agotarse. Su efecto continúa impulsando modelos de lenguaje grandes (LLM) y multimodales. La IA también está aprendiendo a "auto-evolucionarse", usando IA para escribir y actualizar código, acercándose a la posibilidad de tomar el control del mundo digital. El próximo campo de batalla clave son los **Modelos Mundiales (World Models)**, que buscan que la IA comprenda e interactúe con el mundo físico. Sin embargo, aún no existe un consenso sobre la ruta técnica óptima (basada en lenguaje, píxeles, estructuras 3D o representaciones visuales) y persisten desafíos con los datos. Se estima que su desarrollo y convergencia llevarán de 3 a 5 años más. En el frente de la aplicación, los **Agentes (Agents)** son clave para llevar la IA a la vida cotidiana. Han pasado de ser "utilizables" a empezar a ser "útiles", volviéndose más proactivos y capaces de manejar tareas complejas en campos como la medicina o la investigación. Para que sean realmente "buenos", es crucial perfeccionar el **Harness**: el marco o entorno de ingeniería que gestiona la comprensión de la intención del usuario, la planificación de tareas, la ejecución y la verificación, superando las limitaciones del modelo solo. En resumen, la IA está en una carrera acelerada en dos frentes: hacia dentro, dominando y auto-evolucionando el mundo digital; y hacia fuera, buscando comprender y actuar en el mundo físico a través de Modelos Mundiales y Agentes más competentes.

marsbit06/13 02:55

Tiemblen humanos, la IA sigue acelerando a toda velocidad

marsbit06/13 02:55

"No necesito un modelo mejor": El panorama de la IA bajo un popular post de Reddit

"Claude Fable 5, el nuevo modelo flagship de Anthropic, marcó un 80.3% en el benchmark SWE-Bench Pro, superando ampliamente a modelos anteriores. Sin embargo, una publicación viral en Reddit titulada 'Claude Fable me hizo darme cuenta de que no necesito un modelo mejor' refleja una desconexión entre las métricas técnicas y la percepción de muchos usuarios. Los comentarios más votados expresan 'fatiga' por las mejoras incrementales, argumentando que modelos como Opus 4.8 ya son 'suficientes' para sus flujos de trabajo diarios. La queja principal gira en torno al costo (el doble que Opus) y, sobre todo, a los estrictos 'guardrails' de seguridad de Fable 5. Usuarios reportan que solicitudes relacionadas con ciberseguridad son rechutadas con frecuencia, siendo derivadas a Opus, lo que genera frustración especialmente entre suscriptores de pago. No obstante, usuarios con tareas complejas y de gran escala, como simulaciones de física de miles de líneas de código, defienden el modelo, describiendo una diferencia sustancial y capacidades superiores para contextos largos y análisis profundo. El debate subraya una posible meseta en la percepción pública de la utilidad de la IA: mientras los benchmarks siguen mejorando, para muchos usuarios el 'techo' de necesidades prácticas ya fue alcanzado. La discusión también señala la brecha entre los modelos de acceso público y las versiones más potentes y restringidas, como Mythos 5, disponible solo para gobiernos y empresas críticas. El futuro de estos modelos públicos dependerá de equilibrar capacidad, costo y usabilidad."

marsbit06/12 02:55

"No necesito un modelo mejor": El panorama de la IA bajo un popular post de Reddit

marsbit06/12 02:55

Subsidios → tarificación por Token → reducción de precios: ¿Inicia OpenAI la guerra de precios y se acerca el punto de inflexión de la economía del Token?

La comercialización de la IA generativa enfrenta una revisión profunda tras la evolución desde suscripciones mensuales hasta la facturación por tokens, que ha expuesto los altos costos reales para las empresas. Según The Wall Street Journal, OpenAI considera reducir drásticamente los precios de los tokens para competir con Anthropic, lo que podría desencadenar una guerra de precios. Esta situación es crítica, ya que ambas empresas ya registran pérdidas millonarias debido a los elevados costos de computación. La facturación por tokens ha revelado gastos descontrolados: empresas como Uber agotaron su presupuesto anual en meses, mientras estudios muestran que solo el 18% del gasto en tokens genera valor real para los usuarios. Ante esto, las empresas están implementando controles más estrictos. Expertos como Gary Marcus advierten que una caída de OpenAI podría afectar a gigantes como Nvidia y Oracle. Mientras tanto, actores como DeepSeek, con precios significativamente más bajos, ganan terreno en el mercado estadounidense. El futuro de la economía del token podría incluir modelos de precios por capas o basados en la escasez, enfocándose en maximizar el valor por token en lugar del volumen. Sin embargo, la batalla de precios actual podría redefinir el panorama, beneficiando a proveedores con modelos de coste más eficientes.

marsbit06/11 23:54

Subsidios → tarificación por Token → reducción de precios: ¿Inicia OpenAI la guerra de precios y se acerca el punto de inflexión de la economía del Token?

marsbit06/11 23:54

Justo ahora, Claude Mythos 5 es lanzado: 50 millones de líneas de código resueltas en un día

Anthropic ha lanzado Claude Fable 5 y Claude Mythos 5, sus modelos de IA más potentes hasta la fecha. Fable 5, disponible públicamente con salvaguardas, se degrada automáticamente a Claude Opus 4.8 para consultas de alto riesgo, mientras que Mythos 5 es la versión completa restringida. Fable 5 destaca en ingeniería de software, completando en un día una migración de 50 millones de líneas de código que llevaría meses a un equipo. Posee capacidades visuales nativas, pudiendo completar videojuegos solo con capturas de pantalla, y una memoria mejorada para tareas largas y complejas. En pruebas financieras y de investigación científica, muestra un rendimiento líder, con Mythos 5 diseñando compuestos proteicos que ya están en desarrollo farmacéutico. El modelo introduce un nuevo paradigma de seguridad mediante clasificadores y enrutamiento, reteniendo datos de uso por 30 días para monitorización. Su eficiencia en tokens busca controlar costes en tareas autónomas prolongadas. Experiencias de prueba, como la del profesor Ethan Mollick, indican un cambio fundamental: el humano actúa más como un "cliente" que supervisa, mientras la IA opera de forma autónoma como un "estudio" completo, entregando resultados complejos con una intervención mínima. Fable 5 es de uso gratuito para suscriptores hasta el 22 de junio, tras lo cual requerirá créditos adicionales.

marsbit06/10 00:29

Justo ahora, Claude Mythos 5 es lanzado: 50 millones de líneas de código resueltas en un día

marsbit06/10 00:29

Apple finalmente admite que Siri se ha quedado vieja

Apple finalmente reconoce que Siri se ha quedado atrás. En WWDC 2026, la compañía presentó una profunda renovación, renombrando su asistente como Siri AI y anunciando una colaboración estratégica con Google. Utilizarán el modelo Gemini para entrenar sus nuevos modelos base de Apple Foundation, con versiones que van desde 3,000 millones de parámetros en el dispositivo hasta modelos más potentes en la nube, utilizando por primera vez la infraestructura de Google Cloud y GPUs de Nvidia. La presentación mostró una Siri rediseñada con memoria, una aplicación independiente, sincronización entre dispositivos y una integración más profunda en el sistema. Apple Intelligence busca ser una capa de ayuda cognitiva que resuma notificaciones, redacte correos y automatice tareas, más allá de ser un simple chatbot. Este giro marca un cambio significativo. Apple, pionera en asistentes personales con Siri en 2011, priorizó durante años el control, la privacidad y la inteligencia en el dispositivo, lo que limitó su evolución. Ahora, ante la competencia de IA generativa, recurre a Google y Nvidia, cediendo parte de su soberanía tecnológica para no perder el control del futuro centro de inteligencia personal: el propio dispositivo. El gran desafío será la implementación en mercados como China, donde las regulaciones locales probablemente resulten en un producto distinto. Además, las funciones más avanzadas de Apple Intelligence solo estarán disponibles en los modelos de iPhone más recientes, planteando una nueva barrera de hardware. El objetivo final ya no es solo ser más inteligente, sino entender el contexto de la vida del usuario y aprender dónde detenerse.

marsbit06/09 07:22

Apple finalmente admite que Siri se ha quedado vieja

marsbit06/09 07:22

Del Código a la Cognición: Una Guía de Diez Mil Palabras sobre la Evolución del Cerebro Robótico

Desde el código clásico hasta los modelos que simulan la realidad: así ha evolucionado la inteligencia de los robots. Durante décadas, dependieron de software programado manualmente (percepción, planificación, control) para tareas específicas pero rígidas. La llegada del *deep learning* y el aprendizaje por refuerzo mejoró la percepción y el control, aunque con escasa capacidad de generalización. La aparición de los grandes modelos de lenguaje (LLM) marcó un punto de inflexión, actuando como "compiladores de lenguaje natural" que traducen órdenes en planes de acción ejecutables por sistemas como ROS. Sin embargo, el avance definitivo llegó con los **Modelos Visión-Lenguaje-Acción (VLA)**, que fusionan la percepción visual, la comprensión del lenguaje y la generación de movimientos en una sola red neuronal, permitiendo una adaptación mucho mayor. Los robots más avanzados actualmente utilizan una **arquitectura de doble cerebro**: un sistema lento (S2) para el razonamiento de alto nivel y uno rápido (S1) para el control motor reactivo, a veces con un tercer nivel reflejo (S0) para el equilibrio. Todo el procesamiento crítico se ejecuta localmente en el robot por motivos de seguridad y latencia. El siguiente gran salto son los **Modelos del Mundo**. Estas redes no predicen la siguiente acción, sino las consecuencias físicas de las acciones posibles, permitiendo al robot "imaginar" y evaluar futuros antes de actuar. Esto mejora drásticamente la recuperación ante errores, la planificación a largo plazo y la generalización. Modelos como NVIDIA Cosmos, DeepMind Genie y Meta V-JEPA exploran diferentes enfoques arquitectónicos para lograrlo. Aunque los precios del hardware caen y los modelos open-source aceleran el desarrollo, desafíos como la eficiencia en el aprendizaje, la generalización entre robots físicos y el razonamiento de sentido común persisten. La inteligencia robótica está en plena evolución, transitando desde un código predecible hacia sistemas capaces de aprender y simular el mundo que los rodea.

marsbit06/07 13:06

Del Código a la Cognición: Una Guía de Diez Mil Palabras sobre la Evolución del Cerebro Robótico

marsbit06/07 13:06

活动图片