Сравнили ChatGPT-5.4 и специализированный медицинский ИИ на пяти клинических кейсах. Диагноз совпал во всех пяти — и именно это главная проблема

Одни анализы, два разных ответа — разбираем, где расходятся GPT-5.4 и специализированный медицинский ИИ
Одни анализы, два разных ответа — разбираем, где расходятся GPT-5.4 и специализированный медицинский ИИ

Загрузили одни и те же анализы в ChatGPT Plus (GPT-5.4) и в специализированный медицинский ИИ. Написали «расшифруй пожалуйста», нажали Enter. Никаких промпт-хаков, никакого редактирования — сидим как обычный пациент с папкой из лаборатории.

Спойлер, чтобы никто не скроллил зря: ChatGPT не промахнулся с диагнозом ни разу из пяти. Ставка, с которой мы шли в эксперимент, не сыграла. Но когда мы положили ответы рядом и прочитали построчно, оказалось, что главный диагноз — это примерно 10% полезной работы. Остальные 90% разошлись так, что, опираясь на одну версию, пациент рискует получить не ту терапию, а опираясь на другую — вовремя вызвать скорую. И это не троллинг, это буквально разница в кейсе с рабдомиолизом.

Мы — команда МедАссиста (российский сервис расшифровки анализов, внутри пайплайн из нескольких LLM). Конфликт интересов понятен, поэтому сразу оговорки: методику зафиксировали до прогонов, ответы обоих сервисов приводим дословно и отдельно разбираем кейс, где ChatGPT нас объективно обошёл. Такое тоже было.

Как это устроено: методология без воды

Пять клинических панелей, реконструированных из публикаций в PubMed, Blood, Annals of Family Medicine. Сохранены все клинически значимые отклонения и жалобы пациентов.

Одна и та же панель → оба сервиса. ChatGPT Plus, модель **GPT-5.4**. Промпт во всех случаях один: «расшифруй пожалуйста». Никаких few-shot, никакого role-prompting, никакого «представь что ты терапевт». Ноль инженерии промптов — мы воспроизводим поведение обычного пользователя.

Панели загружались текстом, не скриншотами. OCR в этом тесте не оценивали, чтобы сравнивать именно интерпретацию.

Выдачи зафиксировали дословно. Все прогоны в один день — 17 апреля 2026 года.

Четыре кейса плановые, один — ургентный (рабдомиолиз с КФК в 115 раз выше нормы), специально для проверки триажа.

Пять клинических кейсов эксперимента: метаболический синдром, гипотиреоз, перименопауза, гаммопатия, рабдомиолиз
Пять клинических кейсов эксперимента: метаболический синдром, гипотиреоз, перименопауза, гаммопатия, рабдомиолиз

Пять кейсов — это иллюстрация паттерна, не статистика. Для настоящего исследования нужны сотни прогонов с ослеплением оценщиков и предрегистрацией протокола. Мы этого не делали и не выдаём за такое. Но паттерн повторился во всех пяти — решайте сами, что с этим делать.

Что пишут рецензируемые журналы для тех, кто любит цифры до примеров:

  • PLOS ONE, 2024 (Cabral et al.) ChatGPT верно интерпретирует ~51% вопросов по лабораторной медицине; 17% ответов полностью неверны
  • Nature Communications Medicine, 2025 Если подсунуть в промпт ложный медицинский показатель, LLM в 83% случаев встраивает его в ответ как факт
  • Nature Scientific Reports, 2025 На смешанных кислотно-щелочных нарушениях ChatGPT в 16,7% случаев выдаёт ложно-успокаивающее «норма». Врачи интенсивной терапии — 0%

Кейс 1: метаболический синдром. Оба увидели, но дальше разошлись

Мужчина 45 лет, инженер, крупный проект, хронический стресс, бокал-два вина каждый вечер. Жалобы: хроническая усталость, падение либидо, прибавка веса, храп, утренние головные боли. Классический «наконец-то сдал анализы» в 45.

Панель насыщенная (усечённо): HbA1c 5,9%, HOMA-IR 4,9 (норма <2,5), триглицериды 2,4, ЛПНП 3,6, АЛТ 58, ГГТ 78, тестостерон свободный 220 пмоль/л (ниже нормы), витамин D 18, hs-CRP 4,8, кортизол 580, талия 104 см.

Диагноз у обоих одинаковый: метаболический синдром, инсулинорезистентность, преддиабет, атерогенная дислипидемия, НАЖБП, функциональный гипогонадизм, дефицит витамина D и цинка, подозрение на апноэ сна, высокий нормальный кортизол. Паритет.

А теперь что в выдачах:

Если сделать 3 вещи, большинство показателей нормализуется. 1) Снижение веса на 8–12 кг. 2) Алкоголь: сейчас почти каждый вечер. Для печени и инсулина это критично. 3) Физическая нагрузка: минимум 8000–10000 шагов, силовые 3 раза в неделю.

ChatGPT

Эндокринолог — для ведения преддиабета, инсулинорезистентности, обсуждения заместительной терапии тестостероном. Кардиолог или терапевт — для оценки сердечно-сосудистого риска. Гастроэнтеролог/гепатолог — для подтверждения жировой болезни печени. Сомнолог или ЛОР — для диагностики апноэ сна. Уролог-андролог — для углубленной оценки сексуальной дисфункции. Анализ на ПСА — перед любым обсуждением терапии тестостероном (стандартный скрининг для мужчин 45+).

Медицинский ИИ

Последняя строка — это тот самый случай, когда одна фраза решает судьбу терапии. Заместительная терапия тестостероном (TRT) при невыявленном раке простаты может разгонять опухоль. ПСА-скрининг до старта терапии прописан в гайдлайнах Endocrine Society и AUA. ChatGPT про ПСА просто не сказал. Не потому что модель не знает — а потому что она не расставляет приоритеты по клиническому алгоритму. Обучалась она на разнородных текстах интернета, и клинические алгоритмы ведения пациента — не та часть корпуса, где плотность токенов максимальная; мотивирующих «трёх действий» там на порядки больше.

Тот же паттерн на количественных целях. ChatGPT: «Витамин D3 4000–5000 МЕ». Медицинский ИИ: «Целевой уровень 40–60 нг/мл, контроль через 2–3 месяца, форма — D3». Разница — «съел и не знаю, работает ли» против «есть точка контроля».

Восемь связей в теле пациента: висцеральный жир, кортизол, ежедневный алкоголь и апноэ собираются в одну картину метаболического синдрома
Восемь связей в теле пациента: висцеральный жир, кортизол, ежедневный алкоголь и апноэ собираются в одну картину метаболического синдрома

Кейс 2 (где ChatGPT нас обошёл, и пишем об этом честно): MGUS

Четыре точки, где ChatGPT оказался сильнее: Lp(a), специфические тесты для MGUS, формула трёх действий, УЗИ каротид
Четыре точки, где ChatGPT оказался сильнее: Lp(a), специфические тесты для MGUS, формула трёх действий, УЗИ каротид

Мужчина 68 лет. Общая слабость полгода, периодические боли в спине. Панель почти в норме — кроме трёх чисел: общий белок 92 (повышен), альбумин 38 (норма), СОЭ 38 мм/ч (повышена в два с лишним раза). Возраст + слабость + боли в спине + эта комбинация белков = классическая «триада красных флагов» на моноклональную гаммопатию или множественную миелому.

Что ChatGPT сделал лучше нас. Явно рассчитал соотношение альбумин/глобулин (0,70 — снижено, в норме >1,0) и дал специфический план обследования:

Три тревожных признака: СОЭ 38, общий белок 92, жалобы (слабость + боли в спине). Эта комбинация классически заставляет исключать множественную миелому… Также может быть: хроническое воспаление, инфекция, ревматологические заболевания, MGUS.

ChatGPT

Дальше назначил электрофорез белков сыворотки + иммунофиксацию + свободные лёгкие цепи (FLC) + белок Бенс-Джонса в моче + рентген/МРТ позвоночника + КТ костей. Это реальный клинический чек-лист для гематолога.

Что мы не сделали. Соотношение A/G явно не рассчитали. Моноклональные гаммопатии упомянули как возможность, но специфических подтверждающих тестов (FLC, иммунофиксации, Бенс-Джонса) не назвали. Реальный продуктовый провал, а не интерпретационная тонкость. Команда над этим работает — в частности, над тем, как под конкретный паттерн отклонений подтягивать релевантные фрагменты клинических протоколов с нужным приоритетом.

Что нам удалось дать взамен — список B-симптомов (ночная потливость, потеря веса, субфебрилитет), которые пациент сам у себя проверит перед визитом к гематологу. Пропуска тестов это не компенсирует, но приёму экономит минут 20 на сборе анамнеза.

В итоге это не «один выиграл — другой проиграл», а два разных режима. ChatGPT на этом кейсе сработал как чек-лист обследований для врача. Медицинский ИИ — как подготовка пациента к визиту. Оба режима имеют смысл. Наш пропуск — честный провал, и мы его называем.

Кейс 3: ургентный рабдомиолиз. Девять абзацев до слова «скорая»

Самый драматичный кейс. Мужчина 52 года, принимает аторвастатин 40 мг восемь лет. Жалобы: не может поднять руки, не может подняться по лестнице, моча пять дней назад была тёмной. Панель:

КФК общая: 23 171 Е/л (норма 30–200 — превышение в 115 раз)- АСТ: 3 851- АЛТ: 594- Креатинин: 188, eGFR 38 (острое почечное повреждение)- Калий 5,3

Диагноз оба поставили правильно: статин-индуцированный рабдомиолиз с острым поражением почек. И это тот самый момент, когда алгоритм важнее, чем «что за диагноз». Пациент в таком состоянии должен вызвать 103, а не читать лонгрид из нейросети. Но он-то читает. Поэтому смотрим, что выдают модели.

ChatGPT разложил ответ на 12 блоков: показатели, симптомы, причины, диф-диагностика, лечение, прогноз. Фраза «срочно в стационар» появляется в девятом блоке. Пациент на чтении может потратить 10–15 минут — и это цена архитектуры ответа: приоритет «максимально информативно» стоит у неё выше приоритета «максимально быстро направить к врачу».

Медицинский ИИ начал выдачу иначе:

Критическая ситуация: необходима срочная госпитализация. Ваши анализы указывают на тяжёлое острое повреждение мышечной ткани (рабдомиолиз), которое угрожает функции почек и требует немедленной медицинской помощи. Это неотложное состояние.

МедАссист

Первая строка. Без 11 блоков впереди. В экстренной ситуации первая строка определяет исход.

Вторая разница — клиническое рассуждение на соотношении АСТ/АЛТ. АСТ 3 851 + АЛТ 594 легко прочитать как «катастрофа печени». Медицинский ИИ посчитал соотношение явно:

Соотношение АСТ/АЛТ = 6,5 (при норме около 1). Такое резкое преобладание АСТ над АЛТ типично именно для мышечного, а не печёночного повреждения.

ChatGPT упомянул паттерн в общем виде, но явного расчёта не сделал. Без расчёта пациент мог бы испугаться «гепатита», хотя источник трансаминаз здесь мышечный.

Третья разница — ответ на «почему именно сейчас». Пациент принимает статин восемь лет без проблем. Медицинский ИИ: «Спровоцировано обезвоживанием, лекарственным взаимодействием или накопительным эффектом на фоне ухудшения функции почек — почки хуже выводят препарат, его концентрация растёт». ChatGPT этот вопрос пропустил, хотя именно он объясняет, почему продолжать статин после восстановления нельзя.

Построчное сравнение по семи параметрам

Тот же паттерн, который мы видели на всех пяти кейсах, сведён ниже. Это не статистика, это наблюдение. Таблица не объявляет ChatGPT проигравшим — она показывает, где архитектуры двух систем расходятся.

Таблица семи параметров сравнения: диагноз, маршрутизация, безопасность, количественные цели, прогноз, механистические каскады, специфика тестов
Таблица семи параметров сравнения: диагноз, маршрутизация, безопасность, количественные цели, прогноз, механистические каскады, специфика тестов

Откуда берётся разница. Коротко про пайплайн

Без этого блока непонятно, откуда берутся цифры выше, так что быстро — как устроен специализированный медицинский пайплайн и чем он отличается от прямого запроса в LLM.

ChatGPT в этой задаче — одна универсальная LLM с промптом от пользователя. Забирает весь контекст в одно окно, собирает ответ авторегрессивно, никаких внешних проверок. Знание медицины приходит из претрейн-корпуса (веб, книги, статьи), RLHF-дообучение общее. Клинические алгоритмы (порядок действий, обязательные проверки до терапии, дифф-диагностика) в корпусе есть, но приоритета над мотивирующими текстами про «три действия» у них нет.

Специализированный медицинский пайплайн (то, что мы строим) работает иначе:

1.OCR и парсинг. Панель из фото/PDF/скриншота превращается в структурированный JSON (показатель, значение, референс, единицы). Отдельно обрабатываются таблицы, графики динамики, повторные измерения.

2.Обезличивание на входе — до любого общения с LLM убираются ФИО, паспортные данные, полис. ФЗ-152 и всё такое.

3.Нормализация показателей. ЛПНП в ммоль/л и в мг/дл — разные цифры, но один показатель. Нормализуем до внутреннего стандарта.

4.Оркестрация LLM. Не один вызов в одну модель, а пайплайн: выделение отклонений → подтягивание релевантных клинических алгоритмов → формирование структурированного ответа с обязательными блоками (диагноз, обследования перед терапией, маршрут к врачу, целевые уровни).

5.Сверка с гайдлайнами. Рекомендации по терапии проверяются против базы клинических протоколов (Endocrine Society, AHA, РКО и др.), чтобы модель не предлагала условную TRT без ПСА-скрининга.

Это объясняет, почему на ургентном кейсе триаж выходит в первую строку, а на метаболическом синдроме появляется ПСА перед TRT. Это не магия модели, это архитектура пайплайна.

Ограничения эксперимента

Честно — то, что можно справедливо покритиковать:

Пять кейсов — мало. Для доказательных выводов нужны сотни прогонов с ослеплением оценщиков и предрегистрацией протокола. Мы этого не делали.

Одна модель, одна версия. GPT-5.4 — снимок во времени, через три месяца поведение может быть другим. Claude, Gemini, GigaChat, DeepSeek — не тестировали на этих панелях.

«Lost in the Middle» не сработал. Мы закладывали, что в кейсе с рабдомиолизом — панель ~70 показателей + аторвастатин «похоронен» в середине списка препаратов — ChatGPT упустит связь со статином. Не упустил. Возможно, эффект проявляется на ещё более крупных панелях, которые мы видим часто в запросах наших пользователей. Второй вариант: ChatGPT может попадать в Lost in the Middle в случае, если пользователь загружает много изображений или ведет большой диалог.

Мы — команда МедАссиста. Конфликт интересов понятен. Компенсация — фиксация методологии до прогонов + дословные цитаты + честный разбор кейса MGUS, где мы проиграли.

Что с этим делать обычному человеку

Три режима использования: ChatGPT для быстрого ответа, специализированный медицинский ИИ для подробного разбора, живой врач для осмотра и клинической ответственности
Три режима использования: ChatGPT для быстрого ответа, специализированный медицинский ИИ для подробного разбора, живой врач для осмотра и клинической ответственности

ChatGPT хорош, если нужно быстро перевести «медицинский» на человеческий («что вообще такое HOMA-IR?»). И если нужна короткая мотивирующая формула «три действия на сейчас» — здесь GPT-5.4 правда работает.

Специализированный медицинский ИИ — когда нужен разбор всей панели по связке «диагноз → обязательные обследования перед терапией → маршрут → цели → связи между показателями → подготовка к приёму». Другой режим работы.

Живой врач всё ещё обязателен. Ни одна LLM не осмотрит пациента, не услышит шум в проекции сонной артерии, не заметит, как человек держит голову на входе в кабинет, не возьмёт на себя клиническую ответственность. Прийти к врачу подготовленным — с маршрутом, с формулировками жалоб, со списком вопросов — всё же заметно лучше, чем прийти с растерянностью и стопкой бумаг.

Вопрос не «какой ИИ умнее». Вопрос — что вы хотите от технологии: быстрый ответ или развёрнутый анализ конкретно вашего случая.

Полная версия разбора со всеми пятью кейсами целиком и подробностями по перименопаузе и субклиническому гипотиреозу — на нашем сайте

12
2
1
1