Автор: Li Yuan
Вы когда-нибудь задавали вопросы о своём здоровье ИИ-ассистенту?
Если вы, как и я, активный пользователь ИИ, скорее всего, вы пробовали.
По данным OpenAI, здоровье стало одним из самых популярных сценариев использования ChatGPT: более 230 миллионов человек по всему миру еженедельно задают вопросы, связанные со здоровьем и благополучием.
Именно поэтому к 2026 году здравоохранение, похоже, становится ключевым полем битвы в сфере ИИ.
n7 января OpenAI выпустили ChatGPT Health, позволив пользователям подключать электронные медицинские карты и различные health-приложения для получения более персонализированных медицинских ответов; а 12 января Anthropic немедленно представили Claude for Healthcare, подчеркнув медицинские возможности новой модели.
Однако что интересно, на этот раз китайские компании не отстали и даже показали признаки лидерства.
13 января Baichuan Intelligence объявили о выпуске модели Baichuan-M3, которая превзошла GPT-5.2 High от OpenAI на тестовом наборе HealthBench в области здравоохранения, также выпущенном OpenAI, и заняла первое место (SOTA).
После того как объявление о полном погружении в медицину вызвало множество вопросов, Baichuan Intelligence, похоже, наконец доказали свою состоятельность. Geek Park лично пообщался с Ван Сяочуанем о том, как Baichuan Intelligence оценивают возможности модели M3 и каков финал истории с ИИ в медицине.
01 Впервые превзошли OpenAI в медицинском тестовом наборе
Одним из самых ярких достижений выпущенной модели M3 стало то, что она впервые превзошла GPT-5.2 High от OpenAI на тестовом наборе HealthBench для оценки в области здравоохранения, выпущенном OpenAI, и заняла первое место (SOTA).

SOTA на Healthbench, Healthbench Hard и Hallucination Evaluation
HealthBench — это тестовый набор для оценки в области здравоохранения, выпущенный OpenAI в мае 2025 года. Он был создан совместными усилиями 262 врачей из 60 стран и содержит 5000 групп высокореалистичных многотурновых медицинских диалогов, что делает его одним из самых авторитетных и близких к реальным клиническим сценариям медицинских тестовых наборов в мире.
После выпуска модели OpenAI неизменно лидировали в рейтинге.
На этот раз новая открытая медицинская большая модель Baichuan-M3 от Baichuan Intelligence набрала 65,1 балла в общем зачете, заняв первое место в мире, и даже на HealthBench Hard, который проверяет способность к сложному принятию решений, M3 также одержала победу, обновив рекорд.
Baichuan также одновременно опубликовали результаты теста на уровень галлюцинаций: у модели M3 этот показатель составил 3,5%, что является одним из самых низких в мире.
Важно отметить, что этот уровень галлюцинаций достигнут в чистой настройке модели без использования внешних инструментов поиска.
В Baichuan Intelligence заявили, что ключевым улучшением модели для достижения этих двух пунктов стало внедрение подходящего для медицины алгоритма обучения с подкреплением (Reinforcement Learning).
Baichuan впервые применили в модели M3 технологию Fact Aware RL (обучение с подкреплением с осознанием фактов), что позволило добиться эффекта, при котором модель не говорит шаблонных фраз, но и не говорит ерунды.
В медицинской сфере это на самом деле очень важно.
При задавании медицинских вопросов неоптимизированной модели最容易 возникают две проблемы:一是 модель напрямую выдумывает ваши симптомы и предполагает заболевание; а другая — это семантическая неопределенность, в конечном итоге предлагающая вам все равно обратиться к врачу, что не помогает ни врачам, ни пациентам.
Это происходит потому, что многие модели оптимизируют исключительно на низкий уровень галлюцинаций, и в этом случае модель может нагромождать простые правильные факты, чтобы разбавить общий уровень галлюцинаций. Baichuan внедрили механизм семантической кластеризации и взвешивания по важности — кластеризация устраняет помехи от избыточных формулировок, взвешивание гарантирует, что ключевые медицинские утверждения получают больший вес.
В то же время, если просто ввести строгое штрафование за галлюцинации, это极易 вынудить модель прибегнуть к консервативной стратегии «меньше говорить — меньше ошибаться», поэтому алгоритм Fact Aware RL также включает механизм динамической регулировки весов, который адаптивно балансирует эти две цели в зависимости от текущего уровня способностей модели — на этапе построения способностей упор делается на изучение и выражение медицинских знаний (высокий Task Weight); после созревания способностей постепенно ужесточаются фактологические ограничения (увеличение Hallucination Weight).
При возможности поиска в сети Baichuan также добавили модуль онлайн-проверки на основе многотурового поиска и внедрили эффективную систему кэширования для выравнивания огромного объема медицинских знаний.
02 Уровень опроса превзошел врачей-людей, выход на стадию применимости
Однако превосходство над OpenAI на Healthbench — не единственный яркий момент.
Более интересным моментом стало то, что Baichuan сами креативно построили оценочный набор SCAN-benche. По сравнению с погоней за первым местом в рейтинге OpenAI, набор, созданный самой Baichuan, возможно, лучше отражает направление, в котором Baichuan Intelligence хотят развивать медицину.
Ключевым моментом созданного Baichuan набора для оценки является оптимизация «сквозной способности к проведению опроса». Это основано на экспериментальном инсайте Baichuan: каждое увеличение точности опроса на 2% увеличивает точность результата диагностики на 1%.
То есть, в то время как HealthBench от OpenAI в основном фокусируется на том, «умеет ли ИИ отвечать на вопросы», SCAN-benche от Baichuan надеется оценить: может ли ИИ в процессе вопросов и ответов получать эффективную информацию и одновременно давать правильные результаты диагностики и медицинские рекомендации.
Обычно, когда мы задаем вопрос ИИ-ассистенту, просто указав «вы опытный врач», обычно не приводит к хорошему результату работы модели. Потому что у настоящего врача процесс опроса очень стандартизирован — Baichuan归纳为 четыре象限原则 SCAN: Safety Stratification (安全分层), Clarity Matters (信息澄清), Association & Inquiry (关联追问) и Normative Protocol (规范化输出).
Опираясь на принцип SCAN, Baichuan,借鉴长期医学教育中使用的OSCE方法, совместно с более чем 150 практикующими врачами создали систему оценки SCAN-bench, разбив процесс диагностики на три этапа: сбор анамнеза, вспомогательные обследования, точная диагностика, и проводят оценку динамическим многораундовым способом, полностью имитируя全过程 от приема до диагноза врача, также чтобы получить лучшие результаты на этих этапах и оптимизировать модель.
На этот раз Baichuan также опубликовали результаты оценки модели M3 на SCAN-benche.

Результаты весьма интересны. Baichuan на этот раз сравнивали не только с моделями, но и привлекли для сравнения реальных врачей. И во всех четырех квадрантах врачи-люди уже отстают от уровня, достижимого моделью.
Geek Park специально задали этот вопрос команде Baichuan и получили ответ: в этой оценке все сравнения проводились между моделью и реальными врачами-специалистами на специализированных кейсах. Модель победила, во-первых, потому что она более терпелива, но что более важно, она обладает лучшей способностью к усвоению междисциплинарных знаний.
Например, в одном случае упоминался 10-летний ребенок с повторяющейся лихорадкой, а лихорадка — очень комплексное медицинское явление. Если спрашивать только о кашле и других легочных симптомах, легко упустить серьезные проблемы в суставах и мочевыделительной системе и ошибочно диагностировать обычную инфекцию.
Врачи-люди обычно хорошо разбираются только в симптомах своей специализации, поэтому сложные симптомы часто требуют консилиума специалистов, или даже эксперты по сложным заболеваниям часто обращаются к книгам за информацией.
Обычные модели, не прошедшие специального обучения, а просто играющие роль врача, также часто с трудом справляются с такими вопросами.
03 Следующий шаг: постепенное создание продуктов для конечных пользователей и продвижение более серьезной медицины
Для Baichuan Intelligence преодоление рубежа превосходства над врачами-людьми имеет огромное значение: это означает, что ИИ начинает преодолевать порог применимости и может быть развернут в сценариях использования.
С 13 января пользователи уже могут начать испытывать ответы, предоставляемые моделью M3, на сайте и в приложении Baixiaoying.
Текущий дизайн сайта весьма интересен: хотя все ответы генерируются моделью M3, есть версия для врачей и версия для пользователей. В версии для врачей ответы более лаконичны, содержат больше ссылок на литературу и более «нечеловекообразны». А в версии для обычных пациентов модель почти никогда не дает ответ сразу, а задает больше уточняющих вопросов для более точной диагностики.

В Baichuan Intelligence提到, мыслительные процессы модели в бэкенде很有意思。 «我们经常能看到这个模型在思维链中提到,『这个患者没有理我的这个问题,但是这个问题我必须要问。』甚至我们有看到过那种极端的,说我已经问了患者 20 轮了,这个已经超出了设定的最大轮数,但是这个问题我还是要问。这是因为在训练的过程中模型把话说得讨巧,是得不到奖励的,它必须真的得到了足够多的关键的信息,得到正确的诊断,才能得到奖励。这个是我们跟其他人训练模型的一个明显的不同。」
В последнее время многие компании в сфере ИИ начали介入医疗领域. В Baichuan Intelligence считают, что это их главное отличие — они хотят заниматься более серьезной медициной.
«Это означает, что при выборе сценария Baichuan смотрят не на то, какой сценарий проще всего реализовать. Напротив, Baichuan настаивают на постоянном повышении технических возможностей и решении более сложных проблем», — сказал Ван Сяочуань.
Типичный пример: в будущем Baichuan будут优先做 сценарии решения в онкологии, а психологическое исцеление находится в списке приоритетов Baichuan на более низких позициях.
В общепринятом мнении普遍认为, что предоставление психологического исцеления с помощью ИИ проще и является более легкой для внедрения сценой. Логика суждений Baichuan иная. Они считают, что в онкологии есть более строгие научные основания. Здесь ИИ с большей вероятностью сможет оказать серьезный медицинский эффект, достигнув или превзойдя уровень врачей-людей. В сравнении с этим, в области психологии не хватает таких определенных научных锚ных точек.
Например, некоторые компании选择 создавать цифровые двойники врачей, Ван Сяочуань则认为, что это не то направление, которое хочет выбрать Baichuan. Цифровой двойник врача сам по себе не может полностью воспроизвести уровень врача, и уж тем более превзойти его. Такой ИИ в конечном итоге может стать лишь幌子和 инструментом привлечения клиентов, не способным真正推动严肃医疗.
Эта приверженность серьезности глубоко повлияла на многие бизнес-выборы Baichuan.
Это напрямую связано с размышлениями Ван Сяочуаня о фундаментальной проблеме следующего этапа медицинского ИИ. Он считает, что на текущем этапе最重要的任务是, усиливая возможности ИИ, постепенно提供更多的医疗供给.
Китай多年来 пытается внедрить систему分级诊疗 и врачей общей практики. Первоначальная цель заключалась в том, чтобы люди сначала обращались за помощью на уровне первичного звена, решая проблемы с трудностью записи, длинными очередями и перегруженностью крупных больниц.
Трудности внедрения этой системы本质上 связаны с недостаточностью медицинских ресурсов. В учреждениях первичного звена не хватает врачей высокого уровня. Люди готовы стоять в очередях даже с простудой в больницах третьего уровня, потому что не доверяют уровню диагностики на местах.
Это именно та ключевая точка, где медицинский ИИ может сыграть свою роль. Большие модели способны масштабировать分发顶尖的医学知识. Они填补ют пробел в предложении на местах, позволяя каждому сообществу, каждой семье иметь диагностические способности, как у экспертов больниц третьего уровня.
В долгосрочной перспективе это может иметь более широкое влияние, возможно, перенося право принятия медицинских решений из рук врачей к пользователям. В традиционных медицинских сценариях пациент является受益ентом, но часто не имеет права голоса. Право принятия решений сосредоточено в руках врача. Эта асимметрия власти часто приводит к коммуникационным издержкам и страданиям во время лечения.
А Baichuan希望 с помощью ИИ让患者能够更容易地获得优质医疗资源的供给。«很多人觉得医疗太复杂了,患者是永远理解不了的。但我们想的在美国的司法体系里面有个叫陪审团制度。法律也是非常专业的一个事,陪审团的普通人不懂,那就要求在法官、律师和检察官能够进行带领,做充分的辩论,把话说清楚,说到一个普通人能判断有罪没罪的程度,让普通人能依据逻辑正常判断即可。」 — сказал Ван Сяочуань.
Это также одна из причин, по которой Baichuan Intelligence не хотят заниматься только простыми сценариями, а希望不断向高难度的严肃诊疗推进.
На вопрос о том, является ли решение сложных проблем наиболее коммерчески выгодным, Ван Сяочуань дал глубокий ответ.
Он считает, что решение мелких проблем, таких как простуда и температура,很难在用户心中建立起足够的信任. Медицина — это отрасль, в高度依赖信任. Только когда ИИ сможет решать сложные проблемы, такие как тяжелые заболевания,才能真正 заложить основу доверия.
С коммерческой точки зрения, при столкновении с серьезными проблемами со здоровьем пациенты также более готовы платить за高质量的 ИИ-услуги. Это доверие является не только предпосылкой коммерческой отдачи, но и核心 для масштабируемого применения медицинского ИИ.
И с более фундаментальной точки зрения, медицина для Baichuan Intelligence и лично для Ван Сяочуаня по-прежнему означает путь к искусственному общему интеллекту (AGI).
Ван Сяочуань считает, что ИИ уже нашел практические решения в областях гуманитарных, естественных, технических наук и искусства, медицина же является极为独特的领域. Исследование медицины человеком еще не исчерпано, и ИИ в этой области также находится на стадии摸索.
Дорожная карта Baichuan очень четкая. Сначала повысить эффективность диагностики с помощью ИИ, решить текущую проблему нехватки медицинского предложения. На этой основе Baichuan致力于建立与患者之间的深度信任. Когда пациенты готовы использовать инструменты ИИ для长期医疗咨询, ИИ сможет在长期的陪伴中积累真实且高质量的医疗数据.
Конечная цель этих данных — построить математическую модель жизни. Это путь, который врачи-люди до сих пор не полностью прошли, и весьма вероятно, что в будущем его率先 реализует ИИ. Если удастся смоделировать суть жизни, это станет ключевым шагом к推动通用人工智能迈向更高阶进步.








