Как клинические испытания доказывают, что лекарство работает — и когда это доказательство не срабатывает


До 1962 года Управление по санитарному надзору за качеством пищевых продуктов и медикаментов (FDA) требовало от производителей лекарств доказательств безопасности. Не эффективности, только безопасности. Э
то означало: чтобы вывести препарат на рынок, достаточно было показать, что он не убивает пациентов немедленно. Работает ли он — вопрос оставался открытым.
Закон Кефовера–Харриса, принятый в октябре 1962 года на волне талидомидовой катастрофы, добавил второе требование: доказательства эффективности.
С этого момента производитель обязан предъявить данные контролируемых клинических исследований — данные, которые можно проверить, оспорить и воспроизвести.
За следующие шестьдесят лет клинические испытания превратились в отдельную науку со своим языком, своей статистикой и своими ловушками. Понять её — значит понять, почему одни препараты одобряются быстро, другие годами ждут данных, а третьи выходят на рынок, а потом оказываются бесполезными или вредными.


Четыре фазы

Разработка препарата имеет четыре фазы, каждая из которых отвечает на свой вопрос.
Фаза I: безопасен ли вообще? Первые испытания на людях. Участники — обычно здоровые добровольцы (в онкологии, пациенты у которых исчерпаны другие варианты лечения). Цель: найти максимально переносимую дозу и описать, как организм обращается с веществом — поглощает, распределяет, метаболизирует, выводит. Участников мало: обычно 20–100 человек. Вопрос эффективности здесь не стоит.
Фаза II: есть ли сигнал? Первое столкновение с болезнью. Препарат дают пациентам с целевым диагнозом — ищут признаки того, что что-то происходит: опухоль уменьшается, симптомы снижаются, лабораторные показатели меняются в нужную сторону. Размер выборки — от 100 до 300 человек. Главный риск этой фазы: обнадёживающий сигнал может не воспроизвестись на большей популяции.
Фаза III: работает ли это надёжно? Главные, пивотные (решающие, на основании которых подаётся заявка в FDA) испытания. Тысячи пациентов, сравнение с существующим стандартом лечения или плацебо, строгий контроль. Именно здесь определяется судьба препарата. Стоимость одного исследования Фазы III — от $100 млн до нескольких миллиардов долларов.
Фаза IV: что происходит с миллионами? Постмаркетинговый надзор после одобрения. Клинические испытания, как бы хорошо они ни были спроектированы, охватывают тысячи пациентов за несколько лет. Реальная жизнь — миллионы пациентов за десятилетия. Именно в Фазе IV проявляются редкие побочные эффекты, проблемы длительного применения и риски, которые не были видны раньше. Рофекоксиб (Виокс) прошёл все три фазы, а Merck отозвала его в 2004 году именно потому, что сердечно-сосудистый риск проявился только при наблюдении за десятками миллионов реальных пациентов.


Рандомизированное контролируемое исследование.

Мы дали новый препарат 200 пациентам с депрессией. Через три месяца 60% из них чувствуют себя лучше. Работает?
Не обязательно.
Депрессия часто проходит сама.
Люди, участвующие в исследовании, знают, что за ними наблюдают — и уже от этого чувствуют себя лучше (эффект Хоторна).
Врачи, которые их ведут, могут неосознанно интерпретировать результаты в пользу препарата (предвзятость наблюдателя).
Возможно, в вашу группу попали пациенты с более лёгкими случаями.

Рандомизированное контролируемое исследование (РКИ) решает эти проблемы одновременно.
Рандомизация — случайное распределение участников в группы «препарат» и «контроль». Жеребьёвка устраняет систематическое смещение при отборе: если распределение случайно, все факторы — возраст, тяжесть болезни, сопутствующие диагнозы — в среднем равномерно распределены между группами. Любая разница в результатах с большей вероятностью объясняется именно препаратом, а не изначальными различиями пациентов.
Слепой метод — участники не знают, в какой группе они находятся. Двойной слепой — не знают ни участники, ни врачи. Это устраняет эффект плацебо у пациентов и предвзятость наблюдателей у врачей. Врач не знает, какой препарат получает пациент, и не может интерпретировать результаты в его пользу.
Контрольная группа — сравнение с чем-то: плацебо (таблетка без активного вещества), стандартом лечения или другим препаратом. Без контроля невозможно понять, что именно произвело эффект.

Не всегда возможно провести двойное слепое РКИ. Хирургические вмешательства не ослепишь. Некоторые редкие болезни не дают набрать достаточную выборку.
В онкологии при смертельных диагнозах этически сложно создать группу плацебо. Тогда используют альтернативные дизайны.
Open-label исследование — обе стороны знают, что получает пациент. Меньше контроля, больше возможностей для смещения, но иногда единственный реалистичный вариант.
Single-arm исследование (одна группа, без контроля) — все участники получают препарат, сравнение идёт с историческими данными или с внешней контрольной группой. Часто применяется при орфанных болезнях и при онкологии с высокой неудовлетворённой медицинской потребностью. Именно на таких исследованиях основана значительная часть онкологических одобрений FDA через механизм Accelerated Approval.


Что измеряем. Суррогатные и клинические конечные точки

Это, пожалуй, самый важный концептуальный вопрос клинических испытаний — и источник большинства споров вокруг одобрений FDA.
Клиническая конечная точка — то, что важно самому пациенту: живёт ли он дольше, чувствует ли себя лучше, может ли делать то, чего не мог.
OS (Overall Survival, общая выживаемость) — пациент жив или мёртв. Самая недвусмысленная точка. Её сложно интерпретировать неправильно.
PFS (Progression-Free Survival, выживаемость без прогрессирования) — как долго болезнь не прогрессирует. Промежуточная позиция: не «жив ли», но «болезнь под контролем ли».
Качество жизни — субъективно, но важно. Препарат, добавляющий шесть месяцев жизни при тяжёлой токсичности, может быть хуже для пациента, чем препарат, дающий четыре месяца без побочных эффектов.

Суррогатная конечная точка — биологический маркер, предположительно связанный с клиническим исходом, но сам по себе им не являющийся.
ORR (Objective Response Rate, частота объективного ответа) — опухоль уменьшилась по критериям визуализации. Пациент не обязательно живёт дольше.
Снижение BCR-ABL транскрипта при хроническом миелоидном лейкозе (ХМЛ) — молекулярный ответ при лечении иматинибом. Коррелирует с выживаемостью, но не тождественен ей.
Снижение ЛПНП (холестерина низкой плотности) — статины снижают ЛПНП, но FDA одобряла их именно потому, что статины снижают смертность, а не просто потому что снижают ЛПНП.
Снижение амилоидных бляшек в мозге — именно здесь история становится болезненной.

В 2021 году FDA одобрила адуканумаб (Адухелм) для лечения болезни Альцгеймера через механизм Accelerated Approval на основании суррогатной конечной точки: препарат уменьшал количество амилоидных бляшек в мозге, которые считаются маркером болезни. Десять из одиннадцати членов Advisory Committee (консультативного комитета FDA из внешних экспертов) проголосовали против одобрения: доказательств того, что снижение амилоида улучшает когнитивные функции или замедляет деменцию, в доступных данных не было. FDA одобрила вопреки этому консенсусу. В 2024 году Biogen добровольно отозвала препарат с рынка после коммерческого провала и отказа Medicare покрывать лечение за $56 000 в год.
Адухелм не исключение.
Часть препаратов, одобренных по суррогатным точкам, впоследствии не подтверждает клинической пользы. По данным исследований, опубликованных в JAMA Internal Medicine, среди онкологических препаратов, которые FDA одобрила через Accelerated Approval по суррогатным точкам в 2013–2017 годах, лишь часть в последующих исследованиях показала улучшение OS. Это не означает, что Accelerated Approval — плохой механизм: он позволяет выводить препараты к пациентам быстрее, когда ждать результатов по выживаемости означает терять годы жизни. Но суррогатная точка — это гипотеза, а не доказательство.


p-значение и почему одного числа недостаточно

В конце каждого клинического исследования статистики вычисляют p-значение. Если оно меньше 0,05, результат называют «статистически значимым». Это пороговое значение стало одним из самых неправильно понимаемых чисел в науке.
Что означает p < 0,05: если бы препарат не имел никакого эффекта (нулевая гипотеза), вероятность получить наблюдаемый результат случайно составляет менее 5%. Это не означает «препарат работает с вероятностью 95%» — это частая ошибка. И это не означает, что результат важен клинически.
Возьмем препарат от гипертензии, снижающий систолическое давление на 2 мм рт. ст. При достаточно большой выборке (скажем, 50 000 человек) этот эффект будет статистически значимым с p < 0,001. Но снижение на 2 мм рт. ст. клинически не важно: оно не уменьшает ни инфаркты, ни инсульты.
Что нужно смотреть помимо p-значения?
Абсолютное снижение риска против относительного. Если риск смерти снижается с 2% до 1% — это 50% снижения относительного риска (впечатляет) и 1 процентный пункт абсолютного снижения (скромнее). Маркетинговые материалы почти всегда используют относительный показатель. Регуляторные документы — абсолютный.
NNT (Number Needed to Treat, число пролеченных для предотвращения одного события) — сколько пациентов нужно лечить, чтобы предотвратить один неблагоприятный исход. Для статинов при первичной профилактике NNT составляет от 60 до нескольких сотен — то есть лечение сотен людей предотвращает один инфаркт. Для некоторых онкологических препаратов NNT составляет 2–5. Этот контекст меняет оценку.
Доверительный интервал — диапазон, в котором с вероятностью 95% находится истинный эффект. Если доверительный интервал широкий, данных мало и эффект оценён ненадёжно.


Размер выборки и статистическая мощность

Статистическая мощность исследования — это вероятность обнаружить реальный эффект, если он существует. Стандарт в фармацевтических испытаниях: мощность 80% или выше. Это значит: если препарат действительно работает, исследование обнаружит это в 8 случаях из 10. В 2 случаях из 10 оно ошибочно покажет, что эффекта нет (ошибка второго рода).
Мощность зависит от размера выборки и ожидаемого эффекта. Чем меньше ожидаемый эффект, тем больше нужно участников. Это создаёт проблему для орфанных болезней: при заболевании, которым страдают 3000 человек в стране, невозможно набрать 5000 участников для Фазы III.
Именно поэтому FDA допускает одобрение орфанных препаратов по данным значительно меньших исследований — иногда несколько десятков или сотен пациентов.
Это регуляторный компромисс: неидеальные данные лучше, чем отсутствие лечения.


Промежуточный анализ. Когда исследование останавливают раньше срока

Крупные клинические испытания включают заранее спланированные промежуточные проверки данных. Независимый комитет по мониторингу данных (DSMB — Data Safety Monitoring Board) смотрит на накопленные результаты и решает, продолжать ли испытание.
Исследование останавливают досрочно по двум причинам.
Очевидный вред. Препарат оказался опаснее плацебо. Продолжать было бы неэтично.
Очевидная польза. Эффект настолько убедителен, что держать пациентов контрольной группы на менее эффективном лечении неэтично.
Именно так остановили исследование IRIS — пивотное испытание иматиниба при ХМЛ: данные в пользу Гливека были настолько однозначными, что продолжать держать людей на интерфероне было невозможно.

Досрочная остановка по эффективности — это хорошо для пациентов, но создаёт статистическую проблему: оценки эффекта при остановке часто завышены, потому что исследование остановили именно в момент наиболее благоприятных промежуточных данных. Финальная реальность бывает скромнее.


Мета-анализ. Объединяя доказательства

Ни одно исследование не даёт окончательного ответа. Мета-анализ объединяет данные нескольких исследований, проводя общую статистическую оценку. При правильном проведении это мощный инструмент: суммарная выборка в тысячи участников из десятков исследований надёжнее любого отдельного испытания.
Ограничения мета-анализа:
Garbage in, garbage out — плохо спроектированные исследования, объединённые вместе, дают ненадёжный результат.
Предвзятость публикации — исследования с положительными результатами публикуются чаще, чем с отрицательными. Если мета-анализ включает только опубликованные работы, он систематически переоценивает эффект.
Гетерогенность — если исследования проводились на разных популяциях, с разными дозами, разными конечными точками, их объединение может быть некорректным.

Именно мета-анализ Ирвинга Кирша (2008) показал, что антидепрессанты — селективные ингибиторы обратного захвата серотонина (СИОЗС) — при лёгкой и умеренной депрессии неотличимы от плацебо по клинически значимым критериям, несмотря на то что десятки отдельных исследований показывали статистически значимый эффект. Когда в анализ включили неопубликованные данные, полученные через запросы по Закону о свободе информации (FOIA), картина изменилась.


Воспроизводимость. Когда суррогат не становится реальностью

Accelerated Approval — механизм FDA, позволяющий одобрять препараты на основании суррогатных конечных точек с обязательством компании в последующем подтвердить клиническую пользу в дополнительных исследованиях. Механизм правильный и необходимый.
Но что происходит, когда подтверждение не приходит?
FDA одобрила бевацизумаб (Авастин) в 2008 году для лечения рака молочной железы в режиме Accelerated Approval: в одном исследовании он удвоил PFS (время до прогрессирования опухоли). Это впечатляло. Но три последующих Фазы III не показали улучшения общей выживаемости и качества жизни. В 2011 году FDA отозвала показание рака молочной железы — при сохранении одобрения по другим показаниям, где данные были убедительнее.
Это важный прецедент: PFS и OS не тождественны.
Опухоль может перестать расти (хороший PFS), а пациент живет не дольше — потому что болезнь прогрессирует другим путём, потому что побочные эффекты лечения ускоряют смерть, или просто потому что суррогатная точка не отражает реального механизма болезни.
Число онкологических препаратов, одобренных через Accelerated Approval и впоследствии потерявших показание из-за отсутствия подтверждения, не ничтожно. Именно это стало одним из аргументов для реформы 2022 года: FDA усилила контроль за выполнением постмаркетинговых обязательств по Accelerated Approval и ускорила отзыв показаний в случаях, когда подтверждающие исследования дали отрицательный результат.


Что это значит для понимания одобрений FDA

Каждый раз, когда в новости появляется «FDA одобрила новый препарат от рака», стоит задать несколько вопросов.
Какая конечная точка? Если OS — это убедительно. Если ORR или снижение суррогатного маркера — это сигнал, не доказательство.
Какой размер выборки? 100 пациентов в одном исследовании — это другой уровень уверенности, чем 3000 пациентов в трёх независимых исследованиях.
Это Accelerated Approval или полное одобрение? Accelerated означает: компания ещё должна подтвердить пользу. Полное одобрение означает: FDA сочла подтверждение достаточным.
Что в контрольной группе? Снижение смертности на 30% по сравнению с плацебо при болезни, у которой есть эффективный стандарт лечения, это не то же самое, что снижение на 30% по сравнению с этим стандартом.
Кем финансировалось исследование? Исследования, спонсированные производителем, систематически показывают более благоприятные результаты, чем независимые исследования того же препарата.
Это не означает фальсификацию — это означает выбор дизайна, сравнительной группы и конечных точек, которые делают результат наиболее убедительным.
Клинические испытания — лучший инструмент, который у нас есть для проверки медицинских гипотез. Но инструмент с ограничениями, смещениями и стимулами, которые нужно понимать, чтобы читать медицинские новости не как потребитель, а как скептический читатель.

This page in English→