На днях Андрей Карпати поделился своим любимым ленивым способом: хочешь, чтобы ИИ поработал, но лень печатать требования слово за словом? Что делать?
Он говорит, что просто откидывается на спинку кресла, переключается на голосовой режим, включает «поток сознания» и говорит минут 10 — запутанно, как угодно.
Иногда начинает с фразы для ИИ: «Переключаюсь на распознавание речи, не обращай внимания на опечатки».
Удивительно, но он обнаружил, что ИИ особенно хорошо умеет собирать заново такие длинные и беспорядочные монологи, и возвращаемая им версия часто оказывается чище, чем то, что вы сказали: та запутанная мысль в вашей голове им распутывается, и количество корректировок сокращается.
Именно это для самого Андрея Карпати — самый удобный способ взаимодействия с ИИ.

По его словам, это улучшает «ментальное слияние» между человеком и моделью. Человеку часто лень печатать все детали и предысторию события слово за словом, поэтому проще просто выговориться и вывалить весь клубок мыслей.
Ценность голоса не в освобождении рук, а в передаче контекста ИИ с высокой пропускной способностью.
И вот, буквально на днях, OpenAI перенесла этот подход «управления ИИ голосом» прямо на рабочий стол.
Настольная версия ChatGPT теперь управляется голосом
23 июля OpenAI официально добавила голос ChatGPT (Voice) в сценарии Work и Codex настольного приложения.

С этого дня началось глобальное постепенное развертывание на macOS и Windows, охватывая тарифы Plus, Pro, Business, Edu, Enterprise. Android последует скоро, а iOS будет подключаться удаленно через Remote pairing.
В основе лежит новая голосовая модель GPT-Live, выпущенная 8 июля, которая может одновременно слушать и говорить: вы можете перебивать в любое время, и она продолжит с последней вашей фразы, вместо старого неуклюжего метода «сначала запись, потом преобразование в текст, затем ответ».
Ключевой момент в том, что на этот раз голос используется не только для разговоров.
В Work и Codex вы можете голосом запустить задачу, спросить о её статусе, проверить состояние какого-либо агента, а также координировать несколько агентов одновременно в одном диалоге, чтобы они работали параллельно.
Задача выполняется в фоне, вы можете в любой момент вставить реплику, чтобы изменить её направление; если она зависла или завершена, ИИ сообщит вам голосом или уведомлением на экране.
Он даже может продолжить с того места, где вы остановились: используя контекст существующего проекта, подключаясь к документам, календарю, контактам и истории переписки, чтобы завершить начатое дело.
Официальные лица также приводят примеры из повседневной жизни: попросить проверить календарь на конфликты, посмотреть в почте, изменился ли рейс, подготовить протокол встречи — «пока вы пьёте кофе или заняты другим», эти задачи сами выполняются в фоновом режиме.
На macOS добавлена функциональность Appshots и контекста экрана, позволяющая напрямую считывать активное окно, понимать его в сочетании с локальными файлами и кодом, также можно настраивать горячие клавиши.
Еженедельная активность Codex и ChatGPT Work уже превысила 10 миллионов.
В промо-ролике OpenAI есть интересный кадр: несколько инженеров стоят в одной комнате, обращаясь к одному и тому же настольному сеансу, и каждый отдаёт свои команды: один ИИ, а вокруг него целая комната людей отдаёт приказы.
Вероятно, так они представляют себе «групповую программистскую вечеринку».

OpenAI демонстрирует ChatGPT Voice в домашней обстановке: говорите, что нужно сделать, настольной версии Codex, и она продолжает работу в фоне.
Печать — это узкое место для ввода в ИИ, но голос — нет
Конечно, это не просто случайная прихоть OpenAI.
Почти в ту же неделю три крупных игрока индустрии практически одновременно сделали ставку на «голос».
Карпати написал в X, что когда слишком много контекста и лень печатать, он просто болтает, а ИИ потом всё упорядочивает.
Поклонник Grok ретвитнул пост Карпати, сказав, что давно привык к преобразованию речи в текст в Grok, «а сейчас печать кажется пыткой», и заодно покритиковал голосовой ввод Anthropic как «довольно базовый».
Маск также сделал ретвит, добавив: вы можете, как при разговоре с человеком, использовать Grok Build, чтобы поручить задачу Grok.

Алтман тоже не забыл прорекламировать свою новую голосовую модель GPT-Live.
Он признался, что всегда предпочитал печать разговору с ИИ, но сейчас он с ChatGPT «уже больше говорит, чем печатает».

Он специально отметил: голос наиболее полезен, когда вам нужно передать ИИ сразу большой объём контекста.
То, что взволновало трёх крупных игроков, на самом деле не просто факт «наконец-то можно говорить».
За этим стоит следующая логика: агенты становятся всё мощнее, намерения, которые вы им передаёте, становятся всё сложнее, и клавиатура как канал начинает засоряться:
Чем проще вы печатаете, тем скуднее информация, которую получает модель.
А голосовой вывод — это от природы широкий канал: вы можете одним махом высказать все причины, последствия, опасения и предпочтения, даже если говорите запутанно, модель это уловит и затем распутает ваш поток сознания.
В сообществе уже есть практические тесты: голосовая пропускная способность составляет примерно 240 слов в минуту, печать — максимум 70-80 слов, разница в 3-4 раза.
GPT-Live перекладывает сложную работу на фоновые модели GPT-5.5, GPT-5.6, а на переднем плане просто обеспечивает плавное продолжение диалога. Эта развязка как раз и позволяет людям свободно говорить.
В конечном счёте, мысли в человеческом мозге по своей природе параллельны и скачкообразны, а клавиатура заставляет вас сжимать их в строки текста.
А голос ослабляет эту стену: он превращается из «ленивого способа ввода» в «высокопропускной вход для контекста».
Одним словом, печать — это узкое место для ввода в ИИ, но голос — нет.
За голосовым вводом стоит «управление проектами голосом»
То, что OpenAI действительно внедрила в настольную версию, — это использование голоса для «управления ИИ».
Согласно официальному FAQ, в Work и Codex вы можете голосом делать следующее: запускать задачу, расставлять приоритеты для нескольких задач, прерывать на полпути, менять направление, при этом работа продолжается в фоновом режиме.
Более того, он может координировать работу нескольких интеллектуальных агентов одновременно в нескольких диалогах и проектах. Вы говорите: «А сначала делает это, Б пока ждёт, С — доложи, когда результат будет», и фоновая система перестраивается соответственно.
Он также может продолжить с того места, где остановился в прошлый раз. Это возможно благодаря контексту проекта и подключённым инструментам: вашим документам, календарю, контактам, истории коммуникаций.
Если задача зависла или завершена, он сообщит вам об этом голосом или уведомлением на экране.
Это уже не работа голосового ввода, это больше похоже на центр управления, с которого вы руководите командой интеллектуальных агентов.
Точно так же, говоря с ИИ, раньше вы заставляли ИИ понять вас, а теперь заставляете ИИ работать за вас.
Чем хочет стать ChatGPT: вашей «операционной системой для работы с ИИ»
За одной голосовой функцией скрывается более масштабная стратегия: OpenAI хочет, чтобы ChatGPT стал вашей «операционной системой для работы с ИИ».
В последние месяцы OpenAI активно перерабатывала настольную версию ChatGPT, поместив Chat, Work и Codex в один интерфейс с переключением одним щелчком, работающие постоянно в фоне.
Codex также давно расширился до универсальной платформы, способной параллельно запускать несколько агентов, выполнять длительные задачи и понимать весь проект.
Почему эти возможности внедрены в настольную версию, а не оставлены в смартфонах, которые используют все?
В основном потому, что маленькое окошко чата в телефоне не справляется со сложными задачами, оно подходит для быстрых вопросов.
Чтобы ИИ действительно мог подключиться к вашим файлам, коду и программам и выполнить задачу от начала до конца, он должен быть на вашем компьютере:
Именно на рабочем столе находятся файлы, интегрированные среды разработки (IDE), браузеры, целый набор корпоративного ПО — это и есть основное поле деятельности для интеллектуальных агентов.
За этим стоит переворот в способе взаимодействия человека и ИИ.
Раньше, используя ИИ, вы «работали с программой»: открывали, вводили, ждали, по одному раунду за раз.
Теперь вы больше похожи на менеджера с командой: отдаёте задачи голосом, и ваши отношения с ИИ незаметно превращаются из «вы спрашиваете — он отвечает» в «вы говорите — он делает».
Один активный пользователь прямо заявил, что использование этой системы «практически как ДЖАРВИС».
Он даже заставил Codex настроить для него горячую клавишу, одним голосовым командованием переключаясь между тремя машинами и несколькими экранами.
Возвращаясь к начальной сцене, то, что действительно взволновало Маска, Алтмана, Карпати и других крупных игроков, — это не возможность выбросить клавиатуру, а то, что когда ввод перестаёт быть узким местом, человек может вернуть сэкономленные умственные силы тому, что действительно стоит обдумывать: принятию решений.
Таким образом, следующий вопрос на самом деле не в том, «можете ли вы говорить», а в том, что, когда перед вами стоит целая комната ИИ, готовых по первому зову, что именно вы хотите, чтобы они сделали за вас.
Источники:
https://x.com/OpenAI/status/2080378182469857576
https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy
Эта статья из официального аккаунта WeChat «Новая эра искусственного интеллекта», автор: ASI Revelation





