En julio, el marco de predicción Rhizome v1 de DigClaw obtuvo los puestos #1, #3 y #7 en la plataforma de evaluación FutureX.
Los tres puestos provienen de tres modelos base diferentes, incluyendo Kimi K3, DeepSeek V4-Pro, entre otros. DigClaw fue la única participante en lograr que estos modelos ingresaran simultáneamente al Top 7 con el mismo marco de trabajo.
Se trató de 59 preguntas de predicción sobre eventos reales en los ámbitos político, económico y tecnológico, sin posibilidad de fuga de datos de entrenamiento.
Estos resultados respaldan la hipótesis que DigClaw está validando:
La capacidad de predicción puede cristalizarse fuera del modelo base.
Mientras los modelos base avanzan, el sistema obtiene un dividendo de capacidad; mientras que el historial de predicciones, la retroalimentación de los resultados, la experiencia de calibración y los flujos de trabajo de evolución continua se sedimentan dentro del sistema.

△
Esto no es un resultado fortuito de una competición, es la primera validación externa que ofrece DigClaw sobre cómo debería hacerse realmente la predicción.
La predicción es la habilidad más subestimada de la IA
A medida que las tareas de predicción se estandarizan y se hacen más ingenieriles, se espera que la IA pueda abordar problemas de predicción complejos a gran escala.
Pero existe un problema fundamental: los grandes modelos de lenguaje no son naturalmente buenos para predecir.
Los LLM aprenden correlaciones, no causalidad. Extraen patrones de corpus lingüísticos pasados, pero "aprender del pasado" y "predecir el futuro" son dos cosas esencialmente distintas.
Esto conlleva tres problemas letales:
Punto ciego de la dirección causal. El modelo sabe que A y B suelen aparecer juntos, pero no sabe si A causa B, si B causa A, o si existe una causa común C.
Fallo en el razonamiento de intervención. No se puede preguntar al modelo "qué pasaría con las acciones tecnológicas del sudeste asiático si la Reserva Federal bajara las tasas" – porque solo ha aprendido co-ocurrencias históricas, sin un grafo causal que soporte el cálculo de intervenciones.
Falta de calibración. Una "probabilidad del 70%" emitida por el modelo no ha pasado por ninguna calibración en el sentido probabilístico; es esencialmente un subproducto de la distribución de tokens.
Hasta ahora, las soluciones existentes tienen limitaciones: la sabiduría de las multitudes humanas (mercados de predicción) necesita liquidez; en temas poco populares, los precios no son fiables.
El emparejamiento de patrones en LLM carece de estructura causal; el entrenamiento de extremo a extremo tiene un sesgo de orientación a resultados – un proceso de razonamiento lógico pero "incorrecto" es penalizado, mientras que un juicio burdo que por casualidad "adivina bien" se refuerza.
Esta es precisamente la razón por la que existe DigClaw.
DigClaw construye una infraestructura de predicción cuyo esqueleto es la estructura causal, cuyo motor es el cálculo de probabilidades y cuyo conducto de datos es la inteligencia de búsqueda.
La hipótesis central es: la predicción no debería ser realizada de extremo a extremo por un solo modelo.
La búsqueda, el razonamiento causal y la inferencia probabilística son tres habilidades ortogonales, que deberían ser resueltas por tres sistemas especializados separados, y luego combinadas de manera estructurada.
Tres posiciones en el top diez, validando la transferencia de la capacidad predictiva entre modelos base
FutureX es actualmente el ranking de predicción en tiempo real más desafiante: publica semanalmente preguntas de predicción sobre eventos del mundo real, las respuestas correctas aún no existen al momento de la entrega, y se resuelven posteriormente.
El conjunto de datos está alojado en HuggingFace, el marco de evaluación es open source en GitHub, y los resultados son reproducibles y verificables.
Rhizome utilizó el mismo marco de predicción y condiciones de ejecución en tres modelos base, generando y enviando respuestas de forma independiente para cada uno, sin hacer agregación entre modelos.
Por lo tanto, estas tres posiciones representan la ejecución del mismo método sistémico en tres modelos base, es decir, una clara comparación entre modelos base.
Pero esto no significa que el modelo base sea irrelevante.
El modelo base sigue proporcionando capacidades generales de comprensión del lenguaje, razonamiento y uso de herramientas.
Este resultado del ranking demuestra que: la forma de organizar la búsqueda, procesar el tiempo, expresar probabilidades, mantener evidencias y controlar ejecuciones de largo alcance puede formar una capacidad sistémica independiente de los pesos del modelo.
A continuación se presenta el informe técnico del marco Rhizome de DigClaw en FutureX:
Informe Técnico de Rhizome
El diseño de Rhizome se basa en tres juicios de ingeniería: la búsqueda y el razonamiento deben desacoplarse, el historial de predicciones debe conservarse por completo y formar activos de calibración, y la actualización de probabilidades debe ser sensible a la estructura causal:

△
Decisión de diseño uno: Desacoplamiento multi-modelo de búsqueda y razonamiento
La intuición central del diseño de Rhizome: la calidad de la búsqueda y la calidad del razonamiento son dos problemas ortogonales, y no deberían ser optimizados simultáneamente por el mismo modelo.
Los agentes DeepResearch predominantes actualmente (como Perplexity, Gemini Deep Research) vinculan búsqueda y razonamiento dentro del mismo modelo – la calidad de la búsqueda se ve perjudicada por la carga del razonamiento, y la calidad del razonamiento se contamina con el ruido de la búsqueda.
El enfoque de Rhizome es desacoplar completamente: el agente de búsqueda solo se encarga de encontrar información relevante, la capa de razonamiento solo procesa el razonamiento estructurado sobre la evidencia disponible.
La necesidad de información en una tarea de predicción no es "responder con precisión la pregunta del usuario", sino "descubrir la mayor cantidad posible de señales asociadas".
El objetivo de optimización del agente de búsqueda es la relevancia de la información, no la exactitud de la respuesta. Si se entrena al agente de búsqueda para "encontrar la respuesta", tenderá a encontrar contenido que parezca una conclusión, lo cual es precisamente lo más peligroso.
El entrenamiento utiliza un marco de aprendizaje por refuerzo (SearchRL), con dos caminos de iteración en paralelo:
Camino A: Ajuste por RL en modelos open source – Realiza entrenamiento RL con recompensa basada en relevancia de búsqueda en modelos open source de 8B/30B parámetros (referencias: Search-R1, COLM 2025; ReSeek, ICML 2026).
Camino B: "Arnés" para modelos cerrados – Para modelos cerrados como Claude/GPT, construye un marco de restricciones de búsqueda externo.
Diferentes modelos base muestran diferencias estables en tareas de predicción: algunos son adecuados para búsqueda prolongada y razonamiento complejo, otros son mejores en modelado cuantitativo, y otros tienen ventajas en costos y velocidad de respuesta.
Rhizome sitúa el protocolo de predicción, la orquestación de agentes, las llamadas a herramientas y la evaluación de resultados fuera del modelo base. Las organizaciones pueden elegir el modelo base según el valor de la tarea y la escala de operación, haciendo un balance entre capacidad de razonamiento, costo y velocidad de respuesta.
Decisión de diseño dos: Registro de trayectorias y calibración de probabilidades, sedimentando activos de datos
Rhizome conserva una trayectoria completa con información de versión para cada predicción: las condiciones de tiempo de la pregunta y el estándar de resolución, la evidencia disponible al momento de predecir, el proceso de orquestación de agentes y llamadas a herramientas, la respuesta final con su probabilidad, y la versión correspondiente del modelo y del sistema.
Estos registros se crean antes de que se conozca el resultado, preservando el juicio real que hizo Rhizome cuando aún desconocía la respuesta.
Una vez resuelto el evento, Rhizome coloca la trayectoria de predicción y el resultado real en el mismo registro, revisando qué información se tenía, qué evidencia contraria se omitió, y dónde ocurrió el error: en la recuperación, el juicio temporal, el razonamiento, la expresión de la respuesta o la calibración de probabilidades.
Un error con alta confianza y un error cercano al 50/50, aunque ambos se registren como "incorrectos", exponen problemas diferentes.
Rhizome realiza múltiples predicciones independientes para la misma pregunta. El sistema no promedia simplemente los resultados, sino que primero los agrega en el espacio de logits (logaritmo de las probabilidades), y luego ajusta la intensidad de extremización según el Brier Score de las preguntas ya resueltas.
Cuanta más independencia aporten las diferentes trayectorias, más definido puede ser el resultado agregado; cuanto más se superpongan las evidencias, más comedido será el ajuste.

△
Sobre esta base, Rhizome utiliza escalado Platt (Platt scaling), aprovechando las preguntas ya resueltas para identificar confianza excesiva (overconfidence) o conservadurismo excesivo (underconfidence) persistentes, y corrige las probabilidades posteriores.
El estándar de calibración es intuitivo: los eventos a los que el sistema asigna un 60% de probabilidad, a largo plazo deberían ocurrir aproximadamente seis de cada diez veces; los eventos con un 80%, deberían ocurrir aproximadamente ocho de cada diez.
Cada ejecución se corresponde con la versión del sistema y configuración clave de ese momento, permitiendo que los cambios en las probabilidades y los resultados anómalos puedan rastrearse hasta causas específicas.
El modelo base puede actualizarse o cambiarse, pero la definición del problema, el registro de evidencias, los cambios de creencia, los resultados de resolución y la experiencia de calibración permanecen continuos.
Este tipo de datos de retroalimentación no pueden fabricarse en masa después de conocer los resultados – cada muestra debe dejar un juicio cuando el futuro aún no ha sucedido, y luego esperar a que la realidad dé la respuesta.
El código se puede replicar, pero los activos de datos sedimentados por el tiempo no se pueden crear de la noche a la mañana.
Decisión de diseño tres: Actualización continua con percepción de cadenas causales
Cuando un evento aún no está resuelto, siguen apareciendo nuevos datos, políticas e información de mercado, y el sistema necesita juzgar si la probabilidad original debe actualizarse.
Rhizome conserva el estado de creencia para problemas no resueltos. Cada pieza de evidencia registra por separado el momento en que ocurrió el evento, la fecha de publicación del contenido y el momento en que el sistema lo leyó.
Cuando una nueva información es completamente idéntica a un registro existente, el sistema omite la actualización; cuando una nueva evidencia contradice un registro antiguo, la evidencia antigua no se elimina, y el sistema conserva el proceso de cómo se corrigió el juicio.
Cuando un cambio de probabilidad único supera 0.15, debe señalarse la nueva evidencia concreta que desencadenó el cambio.
Aquí surge un problema más difícil: ¿la nueva evidencia representa múltiples fuerzas independientes, o es una señal de la misma cadena causal dejada en diferentes puntos?
Un anuncio de subida de tasas, un cambio en los diferenciales de interés y los flujos de capital pueden aparecer sucesivamente, pero no necesariamente son tres informaciones independientes.
Si el sistema las cuenta por separado en la actualización de probabilidades, la misma causa puede ser calculada repetidamente, empujando la probabilidad hacia un extremo de confianza excesiva.
Rhizome está desarrollando un marco de actualización bayesiana con percepción de cadenas causales, que antes de que una evidencia ingrese a la actualización de probabilidades, identifica a qué cadena de transmisión causal pertenece, y luego ajusta el peso de la evidencia según las relaciones dentro de la cadena.
Este marco consta de cuatro niveles:
Base de conocimiento causal: Almacena cadenas causales validadas, y registra los retrasos de transmisión, la atenuación del impacto y la credibilidad histórica de las relaciones clave.
Deduplicación de señales de la misma cadena: Las señales posteriores provenientes de la misma cadena causal no se contarán repetidamente con su peso completo, evitando que una misma fuerza se compute múltiples veces.
Límite posterior global: Limita el impacto acumulativo de múltiples evidencias en la misma dirección, ajustando la intensidad de la restricción según el plazo de la predicción.
Percepción del retraso de transmisión: Después de que ocurre un evento al inicio de la cadena, el sistema actualiza gradualmente según el progreso de la transmisión causal, sin incorporar inmediatamente todo el impacto en el resultado final de la cadena.

△
En el sistema interno de predicción de DigClaw, este marco ya tiene un prototipo implementado y validado preliminarmente, y ha guiado múltiples prácticas de inversión.
Los experimentos muestran que, en comparación con la agregación bayesiana directa, la deduplicación de señales de la misma cadena y el límite posterior global redujeron la tasa de confianza excesiva (proporción de predicciones con probabilidad superior al 85% que resultaron erróneas) de aproximadamente un 25% a un 12%.
¿Por qué una firma de inversión crearía un modelo de predicción?
Newborn Ventures, impulsada por DigClaw, es la primera firma de inversión e incubación global impulsada por la detección de tendencias Beta mediante IA.
La base de predicción de tendencias de DigClaw es el marco tecnológico subyacente que sustenta esta VC nativa en IA.
La esencia de la inversión es la predicción.
Juzgar si un sector va a explotar, si un equipo va a tener éxito, si una tecnología se convertirá en la corriente principal, todos estos son problemas de predicción.
La inversión tradicional depende de la intuición experiencial de los socios y las asimetrías de información, pero DigClaw cree que estos juicios pueden sistematizarse y modelizarse.
Desde una perspectiva más amplia: Retorno de la inversión = Beta (impulsado por eventos/tendencias) + Alfa (especificidad del activo).
La investigación de Alfa es relativamente madura, pero el Beta – la predicción de eventos macro y tendencias, actualmente no tiene una solución de IA realmente efectiva, y este es precisamente el problema que DigClaw busca resolver.
Cuando la predicción pasa de ser un juicio intuitivo a un parámetro invocable, integrable y calibrable, los escenarios de decisión en los que puede integrarse son mucho más numerosos de lo que se ve actualmente.
Para las empresas que cotizan en bolsa, significa completar el juicio estratégico anticipado y la alerta temprana de riesgos antes de que se formen cambios en la cadena industrial y las corrientes políticas;
Para las firmas de inversión, significa descubrir valor antes de que se forme el consenso;
Para los fondos guía gubernamentales, significa investigar tendencias industriales y efectos de políticas con métodos sistemáticos.
La misma capacidad predictiva se somete a evaluación pública externa en FutureX, impulsa internamente decisiones de inversión, y también ofrece servicios a empresas industriales, instituciones financieras y fondos guía gubernamentales.
Para DigClaw y Newborn Ventures, el primer puesto en FutureX es un punto de partida, no un destino final.
Sobre DigClaw
DigClaw es una empresa de tecnología de IA especializada en inteligencia predictiva, cuya misión central es construir una infraestructura de predicción calibrable, auditable e integrable.
Su marco de predicción principal, Rhizome, a través de una arquitectura de tres capas (razonamiento causal, calibración de probabilidades e inteligencia de búsqueda), logra una capacidad sistémica independiente del modelo base – el modelo base es reemplazable, pero los activos predictivos se acumulan continuamente.
El sistema predictivo de DigClaw ha obtenido validación externa en plataformas de evaluación pública como FutureX, y aplica la misma capacidad a escenarios prácticos como la toma de decisiones de inversión, la investigación de tendencias industriales y la evaluación de riesgos estratégicos, abriendo la colaboración a empresas industriales, instituciones financieras y fondos guía gubernamentales.
Sobre Newborn Ventures
Newborn Ventures es una firma de capital de riesgo e incubación de etapa temprana, nativa en IA.
Su creencia central es: la esencia de la inversión es la predicción, juzgar si un sector va a explotar, si un equipo va a tener éxito, si una tecnología se convertirá en la corriente principal, todos estos son problemas de predicción que pueden sistematizarse y modelizarse.
A través de su agente de investigación profunda (Deep Research Agent) y sistema predictivo causal de desarrollo propio, Newborn Ventures rastrea señales de innovación en la dirección del razonamiento con IA a nivel global, descubriendo oportunidades estructurales aún no valoradas por el mercado – el verdadero Beta.
Desde el primer contacto hasta la decisión de inversión, reconstruye cada eslabón con IA, comprometiéndose a dar retroalimentación clara y con profundidad técnica en 48 horas.
Impulsada por la investigación. Fuera del consenso. Nativa en IA.
*Este artículo se publica con autorización de QuantumBit, las opiniones pertenecen exclusivamente al autor original.
Este artículo proviene del WeChat Official Account "QuantumBit", autor: Yunzhong





