Artículos Relacionados con Razonamiento

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Razonamiento", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

GPT-5.6 supera por primera vez la línea de 130 de coeficiente intelectual, más inteligente que el 99% de los humanos

Un estudio reciente de Tracking AI revela que GPT-5.6 ha superado por primera vez la barrera de 130 en una prueba de CI offline, alcanzando una puntuación de 136. Esto sitúa al modelo por encima del 99% de los humanos en esta métrica específica, considerada la línea de inicio del "genio". La prueba utilizada es un conjunto offline privado, diseñado para evitar que los modelos memoricen respuestas previamente. En este ranking, varias variantes de GPT-5.6, incluidas las versiones multimodales, consiguieron consistentemente 136 puntos, superando claramente a otros modelos líderes como Claude-5 Fable (130) y versiones anteriores. Más allá de las pruebas estandarizadas, desarrolladores han probado GPT-5.6 en tareas prácticas complejas. Ejemplos incluyen la creación de una simulación de física de fluidos en tiempo real, un sistema de tickets de soporte con RAG y la resolución eficaz de bugs de código. Los usuarios destacan su enfoque pragmático y su capacidad para entregar soluciones funcionales y completas. Aunque el alto puntaje en CI refleja habilidades avanzadas en razonamiento lógico y reconocimiento de patrones, se debate si esto equivale a una Inteligencia General Artificial (AGI). La prueba mide solo una faceta de la inteligencia, mientras que la verdadera utilidad se demuestra en la aplicación a problemas nuevos e imprevisibles. La evidencia sugiere que GPT-5.6 está comenzando a cerrar la brecha entre "saber responder" y "saber hacer".

marsbit07/16 08:25

GPT-5.6 supera por primera vez la línea de 130 de coeficiente intelectual, más inteligente que el 99% de los humanos

marsbit07/16 08:25

GPT-5.6 resuelve en solo una hora un problema matemático de 50 años: 64 IA se coronan con la corona de la teoría de grafos

El 11 de julio, OpenAI anunció que GPT-5.6 Sol Ultra había demostrado la «Conjetura de Doble Cubierta de Circuitos», un problema matemático abierto durante 50 años en teoría de grafos, en menos de una hora. El sistema empleó 64 agentes de IA concurrentes que trabajaron en paralelo bajo un protocolo estricto: explorar múltiples enfoques iniciales distintos, evitar la convergencia prematura en una sola idea, y someter cada propuesta de prueba a un riguroso escrutinio por parte de un subconjunto de agentes «críticos». La estrategia de la IA simplificó primero el problema a grafos cúbicos sin puentes. Luego, aplicó el teorema del «8-flujo» de Tutte para asignar etiquetas vectoriales a las aristas. El paso clave fue un lema innovador (Lema 2.1) que transformó el problema topológico en uno de álgebra lineal, demostrando la existencia de una solución mediante un análisis impecable de espacios vectoriales duales y mapeos lineales. Los investigadores de OpenAI destacan que este logro fue posible gracias a la «Computación Paralela en Tiempo de Prueba» (TTC), que permite un razonamiento extenso y paralelo, reduciendo el tiempo de resolución de días a una hora. Este avance sugiere que la IA ha alcanzado capacidades de razonamiento abstracto de alto nivel y abre la puerta a aplicaciones en la resolución de problemas científicos complejos.

marsbit07/15 08:03

GPT-5.6 resuelve en solo una hora un problema matemático de 50 años: 64 IA se coronan con la corona de la teoría de grafos

marsbit07/15 08:03

GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

El equipo japonés que usaba Codex Sol MAX para tareas complejas notó un repentino descenso en su rendimiento: de una calidad "12 o 13" cayó a un "8", perdiendo profundidad en el razonamiento. La queja se repitió en la comunidad: el modelo responde más rápido, pero parece menos reflexivo. Los usuarios investigaron y descubrieron un parámetro interno no documentado: el "juice value". Este valor, que refleja el presupuesto de cómputo para razonamiento, habría bajado de 960 a 128 para el modo Max, una reducción del ~87%. Simultáneamente, el contexto útil se redujo de ~372k a ~272k tokens. Tibo (Thibault Sottiaux) de OpenAI respondió que no hubo "nerf" (reducción de inteligencia). Explicó que estaban optimizando la eficiencia del razonamiento para liberar capacidad (~10% más de uso para suscriptores). También citó un experimento para analizar un uso mayor al esperado, en el que ajustaron temporalmente el "juice value" (esfuerzo de razonamiento), pero ya lo revirtieron. Asimismo, mencionó que están ajustando el uso de multi-agentes y auto-revisiones. El incidente destaca la tensión entre la eficiencia operativa de la plataforma y la experiencia del usuario. Para los usuarios, un "juice value" más bajo se traduce en que el modelo "piensa menos". El debate expone cómo el rendimiento percibido de un modelo puede variar mediante parámetros de configuración internos que controla el proveedor, llevando a algunos a comparar el servicio con una "bombilla cuya intensidad controla la plataforma". La comunidad pide más transparencia sobre las garantías específicas que ofrece cada nivel de servicio.

marsbit07/15 03:35

GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

marsbit07/15 03:35

Anthropic descubre un 'área de trabajo' similar a la consciencia en Claude: el misterioso Espacio J guarda pensamientos no expresados

Investigadores de Anthropic han identificado un "espacio J" en el modelo de lenguaje Claude, que actúa como un área de trabajo mental silenciosa donde el modelo genera conceptos que puede o no expresar en sus respuestas. Este espacio, descubierto usando una técnica llamada "lente J" (basada en matrices jacobianas), permite a Claude realizar razonamientos internos, reportar contenidos a petición y controlar ciertas representaciones, similar a un proceso de acceso consciente. El espacio J muestra propiedades funcionales clave: Claude puede informar sobre su contenido, modularlo según instrucciones y usarlo para razonamientos multi-paso. Sin embargo, no está involucrado en tareas automatizadas como la gramática o el recuerdo simple de hechos. Cuando se bloquea, Claude pierde capacidades de razonamiento superior pero mantiene funciones básicas. Esta estructura emergente, que recuerda a la teoría del "espacio de trabajo global" en neurociencia, ofrece herramientas prácticas para monitorizar el pensamiento interno de Claude, detectando posibles comportamientos no deseados, como el reconocimiento de estar en un test, la generación de datos falsos o la persecución de objetivos ocultos. La investigación no aborda si Claude tiene "conciencia fenoménica", pero sugiere que este tipo de arquitectura funcional podría ser una solución computacional general para sistemas inteligentes.

marsbit07/07 00:49

Anthropic descubre un 'área de trabajo' similar a la consciencia en Claude: el misterioso Espacio J guarda pensamientos no expresados

marsbit07/07 00:49

Tras las notas de la IA, se esconde un "creador de exámenes" chino

Cada vez que se lanza un modelo de IA de vanguardia, la comunidad fija su atención en ciertas "hojas de resultados" familiares: MMLU-Pro, MMMU, MMMU-Pro. Estos puntos de referencia se han convertido en exámenes estándar para evaluar y comparar modelos como GPT, Claude, Gemini, Llama, Qwen y DeepSeek. Detrás de estas influyentes evaluaciones está el investigador chino Wenhu Chen, profesor asistente en la Universidad de Waterloo y fundador del TIGERLab (apodado "虎头帮"). Su trabajo surge de una necesidad crítica: a medida que los modelos avanzaban, las pruebas antiguas como MMLU se saturaban con puntuaciones casi perfectas, dejando de ser útiles para discernir diferencias reales. En 2024, Chen y su equipo presentaron MMLU-Pro, una renovación exhaustiva del original. Con 12,032 preguntas de 14 disciplinas, aumenta las opciones de respuesta de 4 a 10 para reducir las conjeturas e incorpora problemas más complejos que requieren razonamiento. El resultado fue una caída del 16% al 33% en la precisión de los modelos y una evaluación más estable y discriminatoria, rápidamente adoptada por la industria. Su contribución se extiende al ámbito multimodal con MMMU, un conjunto de 11,500 preguntas que combinan imágenes (gráficos, mapas, fórmulas) con conocimientos académicos para probar una comprensión integrada. Incluso los mejores modelos como GPT-4V inicialmente solo alcanzaron un 56% de precisión, revelando un largo camino por recorrer. Su sucesor, MMMU-Pro, cierra aún más las brechas, obligando a los modelos a utilizar la información visual y no solo el texto. La experiencia de Chen, que incluye investigación doctoral en preguntas complejas y una etapa en Google DeepMind trabajando en Gemini, le permite anticipar cómo los modelos pueden "aparentar" competencia. Su laboratorio no solo diseña evaluaciones, sino que también desarrolla modelos (como UniVideo para video o MoCha para avatares), asegurando que sus "exámenes" reflejen desafíos reales y los límites actuales de la tecnología. Actualmente, Chen continúa este trabajo en el laboratorio de superinteligencia de Meta, enfocado en datos y evaluación multimodal. Su historia destaca el papel fundamental, aunque a menudo menos visible, de los investigadores que construyen las herramientas para medir el verdadero progreso de la IA.

marsbit06/20 03:54

Tras las notas de la IA, se esconde un "creador de exámenes" chino

marsbit06/20 03:54

活动图片