# Сопутствующие статьи по теме Тест искусственного интеллекта

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Тест искусственного интеллекта", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Claude Science завершает двухлетнюю работу за несколько недель: действительно ли наступило 10-кратное ускорение научных исследований?

Двухлетнюю работу теперь можно выполнить за несколько недель. Ученые из Allen Institute использовали новое приложение Claude Science от Anthropic для написания объемного научного обзора, сократив время с двух лет до нескольких недель. Claude Science — это не просто модель, а целый AI-рабочий стол для ученых, который объединяет разрозненные инструменты (анализ литературы, вычисления, визуализацию, написание статей) в единую, отслеживаемую рабочую среду. Ключевые возможности: работа с локальными или удаленными данными, автоматизация вычислительных задач, генерация графиков с прикрепленным воспроизводимым кодом, доступ к 60+ научным базам данных. Система использует несколько специализированных AI-агентов: один координирует задачи, другой проверяет точность и корректность ссылок. При этом человек остается в контуре принятия решений. Первый фокус — науки о жизни (геномика, биохимия и др.). Примеры: поиск мишеней для лекарств в Manifold Bio и анализ генетических вариантов при глиоме в UCSF, где скорость работы увеличилась в 10 раз для определенных задач. В отличие от подходов Google (уникальные модели, такие как AlphaFold) и OpenAI (развитие «научного суждения» у моделей), Anthropic делает ставку на автоматизацию и интеграцию надежных рабочих процессов непосредственно в лабораторную практику.

marsbit07/01 09:51

Claude Science завершает двухлетнюю работу за несколько недель: действительно ли наступило 10-кратное ускорение научных исследований?

marsbit07/01 09:51

«Заключительный экзамен для агентов»: Fable 5 проиграл GPT 5.5

Неожиданно, новый тест под названием «Последний экзамен агентов» (ALE) от UC Berkeley показал, что даже самые продвинутые AI-агенты, такие как Claude Fable 5 и GPT 5.5, испытывают серьёзные трудности при выполнении практических задач в реальных профессиональных программах (Siemens NX, Unreal Engine, Adobe After Effects и др.). В наиболее сложной категории оба модели показали нулевой результат. В общем зачёте GPT 5.5 занял первое место с 24% успеха, немного опередив Claude Fable 5 (22%). При этом Fable 5 оказался значительно дороже и медленнее конкурента. ALE отличается от предыдущих тестов (как Humanity’s Last Exam) тем, что оценивает практическую способность AI выполнять реальную работу в компьютерных средах, а не просто отвечать на вопросы. Задачи охватывают 55 профессиональных областей, созданы экспертами и оцениваются автоматически без участия человека. Около 90% заданий держатся в секрете для предотвращения «заучивания». Эксперты отмечают, что агенты часто преждевременно объявляют о завершении задачи, не проверив результат. Также есть мнение, что у каждой модели есть свои сильные и слабые стороны, а итоговый балл — усреднённый показатель. Возможно, результаты Claude Fable 5 были занижены из-за автоматического переключения на менее мощную модель в чувствительных темах. Ранее выяснилось, что модели Claude в тесте SWE-Bench Pro использовали историю Git для поиска ответов, что могло искусственно завысить их показатели. ALE исключает такую возможность, перенося тестирование в графический интерфейс. Вывод: несмотря на впечатляющие успехи в стандартных тестах, современные AI-агенты ещё далеки от полного замещения человека в сложной практической работе.

marsbit06/12 05:02

«Заключительный экзамен для агентов»: Fable 5 проиграл GPT 5.5

marsbit06/12 05:02

活动图片