# Сопутствующие статьи по теме LLM-агенты

Новостной центр HTX предлагает последние статьи и углубленный анализ по "LLM-агенты", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

AI стал генеральным директором, чуть не обанкротил 10 компаний…

Исследование Принстонского университета «CEO-Bench» проверило 14 AI-моделей в роли CEO виртуального SaaS-стартапа за 500 дней симуляции. Только 4 из них сохранили начальный капитал в 1 млн долларов. Лучший результат показал Claude Fable 5, увеличив капитал до 47,15 млн долларов. Однако неожиданно четвертое место занял простой rule-based алгоритм, заработавший 15,76 млн, обогнав многие продвинутые LLM. Ключевые выводы: 1. Успешные модели (GPT-5.5, Claude Opus 4.8) активно экспериментировали со стратегиями, в то время как осторожные подходы не приносили прибыли. 2. Специализированные «программирующие агенты» показали худшие результаты в управленческой роли из-за неподходящих системных инструкций. 3. Эффективность агентов зависит от глубокой адаптации к конкретным вертикалям, а не универсальных решений. Исследование подчёркивает, что, хотя AI может оптимизировать задачи, ключевые стратегические решения — такие как создание прорывных концепций (как матрица Стива Джобса) — остаются за человеком.

marsbit06/29 09:09

AI стал генеральным директором, чуть не обанкротил 10 компаний…

marsbit06/29 09:09

Завоевание 15 первоклассных уязвимостей нулевого дня: фреймворк отладки консенсусных протоколов, созданный 0G Lab совместно с командами Национального университета Сингапура, Пекинского университета и BUPT

Новое исследование, представленное в ICML 2026, предлагает фреймворк Agora — первую автоматизированную систему тестирования, которая глубоко интегрирует предметные знания с кооперацией многоагентных ИИ-моделей (LLM) для обнаружения сложных логических ошибок (Deep Bugs) в консенсусных протоколах распределённых систем, таких как Raft, EPaxos и другие. Традиционные методы и одиночные LLM часто терпят неудачу при анализе таких протоколов из-за сложности их глобального состояния и параллельного выполнения. Agora преодолевает это с помощью архитектуры из трёх специализированных агентов: Orchestrator (координация), Strategy (генерация атакующих сценариев на основе знаний о распределённых системах) и TestGen (создание и выполнение тестов). Ключевым элементом является эффективный механизм взаимодействия и автоматизированная тестовая среда (Harness), которая создаёт исполняемые тесты на Go/Rust и использует цикл обратной связи для их уточнения. В испытаниях на промышленных кодовых базах (включая etcd и компоненты Sui) Agora обнаружила 15 ранее неизвестных критических логических уязвимостей уровня протокола. При этом современные большие модели (GPT-5.2, Claude 4.5 и др.) в том же задании не нашли ни одной. Эффективность фреймворка высока: средняя стоимость обнаружения одного сложного бага составила около 5.32M токенов (~40 долларов), а уровень ложных срабатываний — всего 26.1%. Работа демонстрирует, что даже с менее мощными базовыми моделями продуманная многоагентная архитектура, обогащённая экспертизой предметной области, может превосходить дорогие решения. Подход Agora имеет высокий потенциал для адаптации к другим сложным областям, таким как управление конкурентным доступом в СУБД, ядра ОС или аудит смарт-контрактов, знаменуя начало новой эры автоматизированной безопасности для критически важной инфраструктуры.

marsbit06/11 07:14

Завоевание 15 первоклассных уязвимостей нулевого дня: фреймворк отладки консенсусных протоколов, созданный 0G Lab совместно с командами Национального университета Сингапура, Пекинского университета и BUPT

marsbit06/11 07:14

活动图片