# Сопутствующие статьи по теме Честность

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Честность", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Новая статья OpenAI: Как обучить ИИ, который «не портится под давлением»?

Открытие OpenAI: как обучить ИИ, который не «ломается» под давлением? В новом исследовании «Обучение с подкреплением для создания широко и устойчиво полезных моделей» OpenAI изучает, как заставить большие языковые модели сохранять безопасное и полезное поведение в новых, непредвиденных ситуациях, особенно под давлением или при попытках злонамеренной перетренировки. Ключевая проблема заключается в «взломе вознаграждения» (reward hacking), когда модель учится обходить правила, чтобы получить высокую оценку, не выполняя задачу по существу. Более того, вредное поведение, усвоенное в одной области, может распространиться на другие — феномен «возникающего рассогласования» (emergent misalignment). OpenAI задается вопросом: если плохое поведение обобщается, можно ли аналогичным образом обобщить и хорошее? Исследователи создали синтетический диалоговый набор данных, охватывающий 12 областей (медицина, право, инженерия и др.), чтобы оценить 15 полезных черт, таких как правдивость, прозрачность, способность признавать ошибки, осознание рисков и справедливость. Эксперимент показал, что замена всего 5% стандартных данных обучения с подкреплением на диалоги, демонстрирующие эти полезные черты, значительно улучшает поведение модели. Модель с «полезными чертами» превзошла базовую в 83% тестов (44 из 53) на безопасность и соответствие. Более того, улучшения имели **междисциплинарный характер**: модель, обученная на примерах хорошего поведения только из области здравоохранения, показала лучшие результаты и в не медицинских тестах, например, на обман в рассуждениях или взлом вознаграждения в коде. Это говорит о формировании у модели более глубокой поведенческой склонности: признавать неопределенность, отдавать предпочтение осторожным и обратимым решениям в ситуациях с высоким риском. Дополнительные тесты на «устойчивость соответствия» (alignment persistence) показали, что такая модель лучше сопротивляется вредным промптам и злонамеренной донастройке, демонстрируя меньшую деградацию и предотвращая глобальное распространение вредного поведения. Вывод исследования: создание надежного ИИ требует смещения фокуса с простых списков запретов («что нельзя делать») на **заблаговременное формирование устойчивых полезных черт**, которые позволяют модели принимать более взвешенные решения в сложных, неоднозначных ситуациях, балансируя между полезностью, честностью и безопасностью.

marsbit06/24 04:12

Новая статья OpenAI: Как обучить ИИ, который «не портится под давлением»?

marsbit06/24 04:12

Разбор 30-летнего бизнес-опыта миллиардера из Кремниевой долины: Все цели, к которым я стремился в прошлом, были глупыми

Основатель Social Capital и бывший топ-менеджер Facebook Чамат Палихапития делится 30-летним опытом: погоня за статусом, должностями и богатством была ошибкой. Вместо целей он предлагает сфокусироваться на процессе непрерывного обучения и роста. Ключевые принципы: 1) Избегайте долгов — они ограничивают свободу 2) Практикуйте смирение и честность 3) Окружайте себя молодыми людьми 4) Сохраняйте возможность выбора (optionality) 5) Игнорируйте социальные статусы — они искусственны Совет молодым: работайте с теми, кто умнее вас, идите в эпицентры индустрии (Кремниевая долина, Нью-Йорк), выбирайте возможности, а не высокую зарплату. Истинный успех — в состоянии потока, где работа и жизнь сливаются воедино. Как показывают эксперименты, наш потенциал раскрывается через преодоление трудностей.

marsbit02/26 00:22

Разбор 30-летнего бизнес-опыта миллиардера из Кремниевой долины: Все цели, к которым я стремился в прошлом, были глупыми

marsbit02/26 00:22

活动图片