El galardonado con el Premio Turing Sutton presenta un nuevo trabajo: Utilizando una fórmula de 1967, resuelve un gran defecto del aprendizaje por refuerzo en flujo continuo

marsbitPublicado a 2026-05-10Actualizado a 2026-05-10

Resumen

El ganador del premio Turing Richard Sutton y colaboradores han publicado un nuevo trabajo que aborda un defecto clave del aprendizaje por refuerzo en flujo continuo (streaming RL). Tradicionalmente, el RL profundo colapsa sin búfer de repetición y con tamaño de lote 1, un problema conocido como "barrera de flujo". La investigación anterior StreamX superó esto con trucos de estabilización, pero el nuevo estudio identifica la causa raíz: el tamaño del paso de aprendizaje se define incorrectamente. El equipo propone "Actualizaciones Intencionales" (Intentional Updates), inspiradas en un algoritmo de 1967 (NLMS). En lugar de especificar cuánto mover los parámetros, el método calcula el tamaño del paso para lograr un cambio deseado y consistente en la *salida* de la función (por ejemplo, reducir el error de predicción de valor en un 5%). Esto evita oscilaciones y colapsos. Se presentan tres algoritmos: Intentional TD(λ) para valor, Intentional Q(λ) para control discreto e Intentional Policy Gradient para control continuo. En experimentos con MuJoCo, Atari y MinAtar, los métodos igualan o se acercan al rendimiento de algoritmos estándar como SAC y DQN (que usan búferes grandes), pero con una fracción del coste computacional (hasta ~1/140 de FLOPS por actualización) y mayor robustez, manteniendo el mismo conjunto de hiperparámetros en todas las tareas. El trabajo marca un avance hacia un aprendizaje en línea más estable y eficiente, similar a cómo aprenden los humanos, adecuado ...

A finales de 2024, un artículo titulado "Finalmente funciona el aprendizaje por refuerzo profundo en flujo continuo" (arXiv:2410.14606) generó un amplio debate en la comunidad académica. Los autores, del equipo de Mahmood de la Universidad de Alberta, dedicaron muchas páginas a describir una realidad embarazosa: el aprendizaje por refuerzo, un método que por naturaleza debería "aprender sobre la marcha", en la era de las redes neuronales profundas casi no puede lograrlo. Si simplemente se elimina el búfer de repetición (replay buffer) y se establece el tamaño de lote (batch size) en 1, el entrenamiento colapsa. Lo denominaron la "barrera del flujo continuo" (stream barrier).

Ese artículo propuso la serie de algoritmos StreamX, que, mediante hiperparámetros finamente ajustados, inicialización dispersa y varias técnicas de estabilización, apenas lograron superar este muro.

Sin embargo, menos de un año y medio después, un miembro del mismo grupo de investigación, junto con colaboradores del Instituto Openmind, ofreció una respuesta completamente diferente: la raíz de la barrera del flujo continuo no es "datos insuficientes", sino "unidad incorrecta del tamaño del paso de aprendizaje (step size)".

Título del artículo: Intentional Updates for Streaming Reinforcement Learning

Dirección del artículo: https://arxiv.org/pdf/2604.19033v1

Repositorio de código: https://github.com/sharifnassab/Intentional_RL

Un golpe de acelerador y el tamaño del bache

Imagina que estás aprendiendo a estacionar un coche. El instructor te dice que cada vez "pises el acelerador durante 0.1 segundos". El problema es que, pisando el mismo tiempo de 0.1 segundos, la distancia que avanza el coche puede variar enormemente dependiendo de si es en subida, en bajada, con el vehículo vacío o cargado. A veces se queda a un centímetro de entrar perfectamente, otras veces se queda a 30 centímetros y choca directamente contra la pared.

El tamaño del paso en el aprendizaje por gradiente tradicional hace precisamente eso: especifica cuánto deben moverse los parámetros cada vez, pero no controla en absoluto cuánto cambia realmente la salida de la función. En el entrenamiento por lotes, los errores de cientos o miles de muestras se promedian, diluyendo los casos extremos, y el problema no es tan evidente. Pero en un entorno de "flujo continuo", cada paso tiene solo una muestra, sin promedio posible. Una vez que la dirección del gradiente es inestable, la magnitud de la actualización fluctuará salvajemente — hoy avanza 30 cm, mañana retrocede 50 cm — y el proceso de aprendizaje colapsa en medio de violentas oscilaciones.

Este fenómeno de "sobrepaso y subpaso" (overshooting and undershooting) es particularmente grave en el aprendizaje por refuerzo, porque el gradiente en cada paso de tiempo no solo varía en magnitud, sino que también cambia de dirección a gran velocidad.

Redefiniendo "cuánto debe hacer un paso"

En un artículo publicado recientemente por Arsalan Sharifnassab del Instituto Openmind, junto con Mohamed Elsayed, A. Rupam Mahmood y Richard Sutton de la Universidad de Alberta, entre otros, se propone una solución que plantea el problema desde otro ángulo: En lugar de especificar cuánto deben moverse los parámetros, especifica directamente cuánto debe cambiar la salida de la función.

Esta idea no surgió de la nada. En 1967, los académicos japoneses Nagumo y Noda, en su artículo "A learning method for system identification", ya propusieron el algoritmo "Normalized Least Mean Squares" (NLMS) en el campo del filtrado adaptativo; en esencia, también utilizaban el cambio deseado en la salida para inferir el tamaño del paso, y no al revés. Solo que ese algoritmo solo era aplicable a escenarios lineales simples.

Los investigadores han extendido esta idea al aprendizaje por refuerzo profundo. Lo llaman "Actualizaciones Intencionales" (Intentional Updates): antes de cada actualización, se define claramente "qué quiero lograr con este paso", y luego se deduce inversamente qué tamaño de paso debería usarse.

Para el aprendizaje de valor (es decir, predecir la recompensa futura), definen la intención como: después de cada actualización, el error de predicción del valor del estado actual debería reducirse en una proporción fija — por ejemplo, un 5%, ni más ni menos. Para el aprendizaje de política (es decir, optimizar la acción de decisión), definen la intención como: la probabilidad de selección de la acción actual solo puede cambiar una cantidad "moderada" en cada paso.

Usando la analogía del coche: esto es como si el conductor decidiera antes de cada operación "quiero que el coche avance 20 cm", y luego calcula automáticamente cuánto debe pisar el acelerador según las condiciones actuales de la carretera (pendiente, carga), en lugar de pisar siempre la misma profundidad y dejar las cosas al azar.

El galardonado con el Premio Turing y su rompecabezas

Uno de los firmantes del artículo es Richard S. Sutton — galardonado con el Premio Turing 2024, ampliamente reconocido como "el padre del aprendizaje por refuerzo moderno".

La posición de Sutton en la comunidad académica es comparable a la de Feynman en física: no solo propuso los dos marcos fundamentales del aprendizaje por refuerzo moderno, el aprendizaje por diferencia temporal (TD learning) y el gradiente de política (policy gradient), sino que también coescribió con Andrew Barto el libro más autorizado en el campo, "Reinforcement Learning: An Introduction" (ahora en su segunda edición, disponible para lectura gratuita en línea). Compartió el Premio Turing 2024 con Barto, cuyo veredicto fue "sentar las bases conceptuales y algorítmicas del aprendizaje por refuerzo".

Tras recibir el premio, Sutton no optó por retirarse, sino que invirtió el premio en el Instituto Openmind que fundó, dedicado a financiar a jóvenes investigadores dispuestos a "explorar problemas fundamentales en un entorno libre de presión comercial". Este nuevo artículo surge precisamente de esta institución sin fines de lucro.

Y el primer autor, Sharifnassab, había publicado recientemente en ICML 2025 el marco MetaOptimize, investigando cómo ajustar automáticamente la tasa de aprendizaje en línea. El enfoque de los dos temas es muy consistente: cómo hacer que el tamaño del paso en sí mismo sea más inteligente.

Detalles del algoritmo: más simple de lo imaginado

La derivación matemática de las "Actualizaciones Intencionales" no es compleja; su fórmula central puede describirse en una frase: el tamaño del paso es igual a la "cantidad de cambio deseada en la salida" dividida por la "influencia real de la dirección del gradiente en la salida".

En el aprendizaje de valor, esta "influencia real" es la norma del vector gradiente (equivalente a medir cuán "empinada" es la región de parámetros actual): en áreas más empinadas el paso es más pequeño, en áreas más planas es más grande, garantizando así que el impacto de cada actualización en la función de valor sea consistente.

En el aprendizaje de política, la "cantidad de cambio deseada" se define como proporcional a la función de ventaja (advantage function): cuánto mejor es la acción actual respecto al promedio, la política se mueve en esa dirección en esa medida — normalizando la magnitud mediante una media móvil (running average) para asegurar que, a largo plazo, la magnitud del cambio de política se mantenga estable en un rango interpretable.

Los investigadores también combinaron esta idea central con dos prácticas de ingeniería: el escalado diagonal al estilo RMSProp (para manejar diferencias de escala entre dimensiones de parámetros) y las trazas de elegibilidad (eligibility traces) (que ayudan a propagar la señal de recompensa hacia pasos de tiempo anteriores).

Finalmente, se formaron tres algoritmos completos: Intentional TD (λ) para predicción de valor, Intentional Q (λ) para control de acciones discretas, y Intentional Policy Gradient para control continuo.

Resultados experimentales: Igualando a SAC sin depender de GPU

El artículo evaluó este conjunto de métodos en múltiples benchmarks estándar, y los resultados son impresionantes.

En tareas de control continuo de MuJoCo (incluyendo robots simulados complejos como Ant, Humanoid, HalfCheetah, etc.), el nuevo método Intentional AC, en configuración de flujo continuo (tamaño de lote = 1, sin búfer de repetición), alcanzó en múltiples ocasiones un rendimiento final cercano o incluso comparable al de SAC — un algoritmo que utiliza un gran búfer de repetición por lotes y es prácticamente el estándar de oro actual para tareas de control continuo. En cuanto a carga computacional, las operaciones de punto flotante requeridas para cada actualización de Intentional AC son aproximadamente 1/140 de las de una actualización de SAC.

En juegos de acciones discretas de Atari y MinAtar, el rendimiento de Intentional Q-learning fue igualmente comparable al de DQN que utiliza búfer de repetición, y además se ejecutó exitosamente en todas las tareas con el mismo conjunto de hiperparámetros, sin necesidad de ajustarlos individualmente.

Los investigadores también verificaron específicamente si la "intención" realmente se lograba: midieron la relación entre la cantidad de actualización real y la esperada. En una configuración simplificada con las trazas de elegibilidad deshabilitadas, la desviación estándar de esta relación fue de solo 0.016 a 0.029, con el percentil 99 dentro de 1.07; lo que significa que en la gran mayoría de los casos, la actualización realmente logró "hacer exactamente lo que se dijo que haría".

Además, un conjunto de experimentos de ablación mostró que al eliminar la normalización RMSProp o el término σ, el rendimiento disminuyó pero siguió siendo competitivo, siendo este "escalado intencional" el principal contribuyente, y los otros componentes son auxiliares.

Todavía hay problemas

El marco de "Actualizaciones Intencionales" también mostró una ventaja notable en robustez. Cuando los investigadores eliminaron una por una las diversas técnicas de estabilización auxiliares de las que depende el método StreamX (inicialización dispersa, escalado de recompensas, normalización de entrada, LayerNorm), la degradación del rendimiento de Intentional AC fue significativamente menor que la de StreamAC original, lo que indica que el escalado intencional reduce la dependencia de "muletas" externas desde la raíz.

Pero el artículo también reconoce un problema no completamente resuelto: en el aprendizaje de política, el tamaño del paso depende de la acción muestreada actualmente, lo que implícitamente asigna diferentes "pesos" a diferentes acciones, pudiendo cambiar la dirección esperada del gradiente de política. En las tareas Humanoid y HumanoidStandup, midiendo la similitud del coseno de la dirección de actualización esperada, los investigadores encontraron que este sesgo durante las fases clave de aprendizaje era cercano a 0.96 (casi sin efecto); pero en Ant-v4, el grado de alineación cayó a una mediana de 0.63, indicando que el problema no siempre puede ignorarse.

Los autores señalan que futuras investigaciones deberían buscar estrategias de selección del tamaño del paso independientes de la acción, para que la "intención" también se mantenga insesgada en un sentido esperado. Esta es una tarea clara que queda para quienes sigan esta dirección.

Conclusión: Haciendo que la IA aprenda sobre la marcha como los humanos

El paradigma de entrenamiento actual dominante para modelos grandes depende de la digestión por lotes de cantidades masivas de datos: alimentar todo el texto y código de Internet, iterar repetidamente, hasta que finalmente emergen capacidades asombrosas. Este camino ha demostrado ser efectivo, pero es fundamentalmente "aprender primero, usar después": una vez completado el entrenamiento, el modelo se congela y no puede actualizarse continuamente a partir de cada interacción real posterior.

El aprendizaje por refuerzo en flujo continuo persigue un modo de aprendizaje completamente diferente: no depende de una gran repetición, no depende de grandes clusters de GPU, cada experiencia se convierte inmediatamente en una actualización de parámetros, de manera continua, barata y adaptativa. Esto se acerca más a la forma real de aprender de humanos y animales.

Desde el avance inicial de Elsayed y otros en 2024 de "finalmente funciona", hasta el principio de "actualizaciones intencionales" propuesto en este artículo, el aprendizaje por refuerzo profundo en flujo continuo está madurando a una velocidad sorprendente. No reemplazará a los modelos grandes entrenados por lotes, pero para robots que requieren adaptación en línea a largo plazo, dispositivos de borde (edge), y cualquier escenario de aplicación que no pueda soportar grandes búferes de repetición y clusters de GPU, esta vía se está volviendo cada vez más convincente.

El tamaño del paso no es solo un hiperparámetro, es el compromiso de la IA sobre "cuánto quiere hacer" en cada paso. Cuando ese compromiso finalmente se vuelve controlable, el aprendizaje en sí mismo se estabiliza.

Este artículo proviene del WeChat Official Account "机器之心" (ID: almosthuman2014), autor: 关注RL的

Preguntas relacionadas

Q¿Qué es la 'barrera de streaming' (stream barrier) en el aprendizaje por refuerzo profundo, según se describe en el artículo?

ALa 'barrera de streaming' se refiere a la incapacidad de los métodos modernos de aprendizaje por refuerzo profundo para aprender de manera efectiva en un entorno 'en línea' o de flujo continuo. Cuando se elimina el búfer de reproducción (replay buffer) y el tamaño del lote (batch size) se establece en 1, el entrenamiento colapsa debido a la inestabilidad en las actualizaciones de los parámetros, causada por gradientes de magnitud y dirección muy variables en cada paso.

Q¿Cuál es la idea central detrás del método 'Actualizaciones Intencionales' (Intentional Updates) propuesto en el artículo?

ALa idea central de las 'Actualizaciones Intencionales' es invertir el enfoque tradicional para elegir el tamaño del paso de aprendizaje (step-size). En lugar de especificar cuánto deben moverse los parámetros, el método especifica cuánto debería cambiar la salida de la función (por ejemplo, el error de predicción de valor o la probabilidad de una acción). Luego, se calcula retroactivamente el tamaño de paso necesario para lograr ese cambio específico en la salida, lo que estabiliza el proceso de aprendizaje en entornos de flujo continuo.

Q¿Qué conexión histórica tiene el método 'Actualizaciones Intencionales' con el trabajo de Nagumo y Noda en 1967?

AEl concepto fundamental de las 'Actualizaciones Intencionales' está inspirado en el algoritmo 'Normalized Least Mean Squares' (NLMS) propuesto por Nagumo y Noda en 1967 para el campo de filtrado adaptativo. Ese algoritmo también determinaba el tamaño del paso en función de un cambio deseado en la salida, en lugar de fijar un paso constante para la actualización de parámetros. Los autores del artículo actual generalizan esta idea a los entornos más complejos del aprendizaje por refuerzo profundo.

QSegún los resultados experimentales, ¿cómo se compara el rendimiento de 'Intentional AC' con el del algoritmo SAC en tareas de control continuo como MuJoCo?

AEn tareas de control continuo de MuJoCo (como Ant, Humanoid y HalfCheetah), el método 'Intentional AC' operando en modo de flujo continuo (tamaño de lote = 1, sin búfer de reproducción) logró un rendimiento final que se acerca o incluso iguala al del algoritmo SAC, considerado un estándar de oro que sí utiliza un búfer de reproducción y lotes grandes. Además, cada actualización de 'Intentional AC' requirió aproximadamente 1/140 de las operaciones de punto flotante necesarias para una actualización de SAC.

Q¿Qué problema o limitación potencial identifica el artículo en el enfoque de 'Actualizaciones Intencionales' para el aprendizaje de políticas (policy learning)?

AEl artículo identifica que, en el aprendizaje de políticas, el tamaño del paso calculado depende de la acción muestreada en el paso de tiempo actual. Esto puede introducir un sesgo, ya que diferentes acciones reciben implícitamente diferentes 'pesos' o importancias en la actualización, lo que podría alterar la dirección esperada del gradiente de la política. En algunas tareas (como Ant-v4), este desalineamiento fue más notable, lo que sugiere la necesidad de futuras investigaciones para desarrollar estrategias de selección del tamaño del paso que sean independientes de la acción y, por lo tanto, insesgadas en expectativa.

Lecturas Relacionadas

Diálogo con Ray Dalio: Nos encontramos en una burbuja de IA actualmente, el 1% de mi cartera de inversiones está en Bitcoin

**Fuente: The Diary Of A CEO** **Resumen: Felix, PANews** Ray Dalio, fundador de Bridgewater Associates, advierte sobre una burbuja en la inteligencia artificial actual, comparable a burbujas históricas como la de Internet en 2000. Según Dalio, los signos clásicos están presentes: precios inflados, endeudamiento basado en ganancias especulativas y una posible corrección brusca si suben las tasas de interés o cambian las condiciones económicas. Dalio explica que esta burbuja se enmarca en un "gran ciclo" más amplio —de unos 80 años— caracterizado por tres dinámicas: creciente desigualdad interna, déficits fiscales gubernamentales y cambios en el orden geopolítico mundial. Estados Unidos y otros países occidentales se encuentran en una fase de declive relativo dentro de este ciclo. Para proteger la riqueza personal, Dalio recomienda diversificar las inversiones más allá del efectivo, incluyendo activos como oro, acciones y bonos. Aunque revela que alrededor del 1% de su cartera está en Bitcoin —considerándolo un activo escaso—, prefiere el oro físico por su seguridad histórica y su rol como reserva de los bancos centrales. Sobre el impacto laboral de la IA, Dalio prevé que aumentará la desigualdad, beneficiando sobre todo a los dueños de capital. Sin embargo, destaca que las habilidades humanas —como la intuición y la emoción— seguirán siendo valiosas y complementarias a la IA. En el ámbito geopolítico, Dalio anticipa un mundo más regionalizado, con EE.UU. y China como potencias líderes en sus respectivas esferas, y advierte que conflictos como el de Irán han expuesto debilidades estratégicas de Estados Unidos, acelerando un cambio en el equilibrio global de poder.

marsbitHace 2 hora(s)

Diálogo con Ray Dalio: Nos encontramos en una burbuja de IA actualmente, el 1% de mi cartera de inversiones está en Bitcoin

marsbitHace 2 hora(s)

¡Récord de compras netas extranjeras de 7,2 billones de wones en un solo día! Wall Street: Los vientos en contra de los flujos de capital en el mercado coreano se han disipado

La situación de los flujos de capital en el mercado de valores surcoreano está mostrando un cambio sustancial. El 31 de julio, la inversión extranjera realizó una compra neta récord de aproximadamente 7.2 billones de wones en acciones del KOSPI, marcando una reversión fundamental tras meses de importantes salidas de capital. Según análisis de Citi Research, las ventas netas mensuales de inversores extranjeros se redujeron drásticamente a 9.8 billones de wones en julio, comparado con 48.4 y 44.5 billones en junio y mayo, respectivamente. Paralelamente, los fondos de pensiones y fondos de inversión nacionales se convirtieron en compradores netos en julio (1.0 billón de wones), luego de ser vendedores netos en los dos meses anteriores. Además, la Comisión de Servicios Financieros de Corea implementó nuevas regulaciones que restringen el acceso de inversores minoristas a los ETF apalancados, lo que ha reducido significativamente su volumen de negociación y se espera que mitigue la volatilidad del mercado. Citi Research mantiene su objetivo para el KOSPI en 10,000 puntos, destacando fundamentos sólidos en el sector de chips de memoria, valoraciones históricamente bajas, una fuerte economía local y un entorno político favorable como factores de apoyo. La firma considera que los vientos en contra relacionados con los flujos de capital se están disipando, mientras que los impulsores fundamentales y políticos están ganando fuerza, creando condiciones para una mejora en el mercado.

marsbitHace 2 hora(s)

¡Récord de compras netas extranjeras de 7,2 billones de wones en un solo día! Wall Street: Los vientos en contra de los flujos de capital en el mercado coreano se han disipado

marsbitHace 2 hora(s)

Cómo Convertirse en Algo que la Inteligencia Artificial Jamás Podrá Reemplazar

**Resumen: Cómo ser irremplazable por la IA** Ante el temor de que la IA elimine trabajos, la solución no es resistirse, sino volverse "inempleable": un individuo autónomo que construya su propio proyecto vital y económico. El artículo critica la "esclavitud salarial"—depender de un empleo sin sentido—y propone escapar de ella desarrollando estas cinco capacidades clave: 1. **Agencia**: Capacidad de actuar sin pedir permiso. 2. **Gusto**: Criterio para discernir qué vale la pena crear. 3. **Persuasión**: Habilidad para conectar y lograr que otros valoren tu trabajo. 4. **Persistencia**: Resiliencia para ver los errores como aprendizaje. 5. **Iteración**: Proceso constante de ajuste basado en la retroalimentación. Estas habilidades se cultivan únicamente **haciendo**: creando algo propio. Se recomienda enfocarse en **crear contenido (medios)** más que solo en código, ya que el valor del contenido es subjetivo y requiere un criterio humano que la IA no puede replicar fácilmente, abriendo espacio para talentos auténticos. **Cómo empezar:** El cambio real requiere una transformación de identidad. Para ello: 1. Cambia radicalmente tu entorno (físico y digital). 2. Elige un "vehículo" (como crear contenido) que te dé retroalimentación real del mundo. 3. Dedica 15 minutos a responder preguntas introspectivas para encontrar tu "material en bruto" único y tu perspectiva contraria a la convencional. 4. **Publica tu primera idea mañana mismo.** La acción, el feedback y la iteración constante son el único camino. La conclusión es clara: en lugar de temer a la IA, conviértete en un creador que utilice todas las herramientas (incluida la IA) para construir una vida y un trabajo con significado, autonomía e impacto personal.

marsbitHace 4 hora(s)

Cómo Convertirse en Algo que la Inteligencia Artificial Jamás Podrá Reemplazar

marsbitHace 4 hora(s)

Los lanzamientos de dados mantienen las claves de Bitcoin en un modo aislado, pero no todo el mundo se molestará

El título sugiere que las claves de Bitcoin pueden almacenarse fuera de línea mediante lanzamientos de dados, aunque no todos los usuarios adoptarán este método. El artículo comienza explicando la entropía en la teoría de la información, utilizando ejemplos como monedas y dados. Tras un escándalo reciente con Coldcard, se popularizó la generación de semillas de billetera mediante dados. El texto explica que, aunque físicamente determinista, el lanzamiento es impredecible en la práctica, lo que lo hace útil para la seguridad. Se detalla cómo convertir los resultados en datos binarios, con métodos que van desde el simple "par/impar" hasta el uso de funciones hash para preservar más entropía. Para una frase de recuperación de 12 palabras (128 bits de entropía), se necesitan unos 50 lanzamientos; Coldcard recomienda 99 para mayor seguridad. La vulnerabilidad en Coldcard, relacionada con su generador de números aleatorios, puso en riesgo fondos. Las semillas generadas manualmente con dados no se vieron afectadas, pero el investigador Kevin Loaec señaló que otras funciones del dispositivo (como creación de billeteras de papel o claves de coproreseguridad) sí podían estar comprometidas, incluso si la semilla principal era segura. El artículo argumenta que, aunque técnicamente robusto, el proceso de lanzar dados es lento, propenso a errores y poco práctico para la mayoría, especialmente para nuevos usuarios. Concluye que, aunque debe ser una opción para expertos, el objetivo a largo plazo es que el hardware y software generen aleatoriedad fuerte de forma fiable y accesible. Se aconseja a los usuarios de Coldcard verificar su firmware y las funciones utilizadas, y se destaca la utilidad de las billeteras multisig con dispositivos de diferentes fabricantes para mitigar riesgos.

cryptonews.ruHace 7 hora(s)

Los lanzamientos de dados mantienen las claves de Bitcoin en un modo aislado, pero no todo el mundo se molestará

cryptonews.ruHace 7 hora(s)

Trading

Spot
活动图片