Глава 3. Статистика или чутье
О несовершенстве наших методов
Это была воистину поразительная форель. Чем больше мы на нее смотрели, тем больше восхищались.
Джордж был так очарован, что взобрался на спинку стула, чтобы получше рассмотреть это чудо.
И вдруг стул пошатнулся; Джордж, чтобы удержаться, судорожно уцепился за шкафчик с форелью, шкафчик с грохотом полетел на пол, а за ним последовал сперва стул, а затем и сам Джордж.
– Рыба цела? – в ужасе вскричал я, бросаясь к нему.
– Надеюсь, что да, – ответил Джордж, осторожно поднимаясь на ноги и осматриваясь.
Но он ошибся. Форель лежала на полу, разбитая на тысячу кусков, – я сказал тысячу, но, возможно, их было только девятьсот. Я не считал. Нам показалось весьма странным и непонятным, как чучело форели могло разлететься на такие мелкие куски. Это и впрямь было бы весьма странно и непонятно, будь перед нами действительно чучело. Но чучела не было. Форель была гипсовая.
Джером К. Джером. Трое в лодке, не считая собаки
Последние три десятилетия ознаменовались невероятным ростом технических возможностей. Представьте себе: полная вычислительная мощность космического корабля «Аполлон» была меньше, чем мощность нынешнего смартфона. Люди старшего поколения восхищаются этим, а более молодое поколение не видит в этом ничего необычного. Но эти понимание и простота приборов кажущиеся. Во-первых, из-за чрезвычайной сложности и приборов, и софта они сделаны максимально, как говорится, user friendly (дружественными). Так, некоторые, на самом деле простейшие, функции представляются интуитивно ясными и логичными; молодежь усвоила эту логику с игрушек. Во-вторых (и это главное), приборы просты, когда вы используете наиболее простые и хорошо запрограммированные их возможности. Эти же приборы пасуют, когда задача становится чуть сложнее (например, до сих пор нет хорошей программы- переводчика).
Казалось бы, для языка, где все по правилам (нет исключений), бери формальную грамматику и словарь – и дело в шляпе. На самом деле это не так. Нужны еще посторонние и немалые знания, не заложенные в программе. Таких примеров множество. Naked conductor runs under the carriage – «голый кондуктор бежит под вагоном» или «неизолированный кабель проходит под тележкой»? И то и другое правильно, но абсолютно различно. Чтобы выбрать правильный вариант, необходимы дополнительные знания, которыми должен обладать человек.
В современной науке это, пожалуй, одна из ключевых проблем. Мы находимся в огромной моральной зависимости от машины. Нам кажется, что она не ошибается и дает правильный результат. Как ни странно, это абсолютно верно. Но мы большей частью не умеем правильно задавать вопрос и правильно трактовать ответ. Надо понимать, что практически все современные компьютеры – это электронно-вычислительные машины, которые не умеют думать, а могут только вычислять по четко заданной программе. Любая программа, в свою очередь, имеет определенные, жестко заданные ограничения на входную информацию и, как правило, очень чувствительна к нарушению этих требований. Например, при использовании параметрической статистики, если входные данные должны иметь нормальное распределение и независимость измерений, а у вас это не выполнено, то результат неверен, хотя и правильно сосчитан. Машина все сделала как надо. Это мы «лопухнулись». Причем в последнее время, как видно из научных статей и выступлений, это происходит все чаще.
Почему? Когда 150 лет назад Анджело Моссо делал пионерские работы по изучению реакции мозгового кровотока на психологические стимулы, он видел значимую реакцию прямо на самописце. Ему не приходилось производить с сигналом какие-либо вычисления или преобразования. Когда Н.П. Бехтерева исследовала обнаруженный ею механизм детекции ошибок, сигнал в каждом последующем испытании практически повторялся. Так было и бывает всегда при изучении важных, основополагающих явлений.
Полет Гагарина принципиально доказал, что человек может находиться в космосе. Для доказательства было достаточно одного примера, а затем множество институтов занимались деталями того, как человек может выжить в космосе. Общие фундаментальные закономерности, в принципе, и должны проявляться достаточно выраженно. Но дальше, когда мы пытаемся разобраться в конкретных, весьма тонких особенностях феномена, каждое новое исследование становится все сложнее и сложнее.
Принципиальный момент возник, когда пришлось перейти к изучению слабо зашумленных и сильно зашумленных сигналов, то есть когда мы перешли к деталям, в которых, как известно, кроется дьявол. Как правило, общая закономерность достаточно хорошо воспроизводима. Но когда вы задаете детальные вопросы, ответы становятся неразборчивыми. Представьте оператора справочной в час пик. У него сотни вопросов и только один из них ваш; он отвечает урывками, проглатывая слова, вы пытаетесь его переспрашивать с переменным успехом.
Вот тут-то и случился «обвал». Мы не можем получить сразу всю информацию о событиях в мозге. При всей зыбкости компьютерных аналогий можно сказать, что мозг работает в мультипрограммном режиме. Он одновременно поддерживает нормальное функционирование внутренней среды, движений, произвольного и непроизвольного внимания и массу других функций, исследование только одной из которых является целью работы физиолога. И вот на этом месте много лет назад (можно сказать, от безысходности) был сделан физиологически неверный шаг, который тем не менее позволил существенно продвинуться в исследовании мозга.
Получилась парадоксальная, но нередкая ситуация, когда, пользуясь в общем-то неверными методами, удалось получить правильные результаты. Кстати, ситуация, характерная не только для физиологии. Высокая физика. Изучение теории поля и элементарных частиц. Р. Йост «Общая теория квантованных полей» (1967 г.): «…мы исходим из уравнений, которые не имеют смысла. Мы применяем к их решениям некоторые определенные предписания и приходим, наконец, к степенному ряду, про который мы не знаем, имеет ли он смысл. Несколько первых членов этого ряда приводят, однако, к наилучшим известным предсказаниям…»
Надо отметить, что именно продуктивная работа в таких условиях является мерилом таланта ученого. Сейчас вывести таблицу Менделеева – тема для диплома, а в то время, когда все было «зашумлено» (и веса элементов, и их свойства), это была эпохальная задача. Сеченов и Бехтерев показали нам пример, как из минимального набора данных можно получить глобальные теории.
Суть общепринятого в нейронауках метода, как уже говорилось, заключается в предположении, что сигнал разделяется на собственно полезный сигнал и шум. Это предположение пришло из радиотехники, где оно в большинстве случаев выполнялось, потому что действительно был сигнал слабенького передатчика и не связанный с ним и не зависящий от него атмосферный шум. В мозге же шум принципиально связан с полезным сигналом. Вместе они отражают мультипрограммную работу одного прибора, одной системы. Поэтому изложенный подход принципиально неверен; все сигналы физиологически значимы. Именно поэтому, чтобы получить с его помощью правильные результаты, требовалось не только нажать правильные кнопки статистического анализатора, но и обладать тонким, предельно четким пониманием метода обработки, интерпретации его результатов и организации эксперимента. К сожалению, сегодня это скорее исключение, чем правило.
Основное противоречие в методах статистической обработки и реальной картины заключается в том, что мозг делает работу с первого предъявления. Он не работает на основе статистического накопления результатов. А мы ищем статистически значимый сигнал, разделяя зарегистрированный сигнал на значимый и незначимый. Говоря физическим языком, мы вводим в мозг аналог демона Максвелла, который отделяет мух от котлет.
Голь на выдумки хитра. Умные исследователи придумали паллиативный выход. Делают набор исследований, в которых явление изучается с разных сторон, и рассматривают весь комплекс результатов. Далее, исходя из принципа, что природа сложна, но не злонамеренна, делаются все более приближенные к реальности оценки.
Надо заметить, что Н.П. Бехтеревой был предложен альтернативный усреднению подход. Она взяла за основу предположение, что каждое событие в мозге имеет физиологический смысл. Каждый нейронный импульс отражает работу мозга по обеспечению какого-либо процесса. Вместе с гипотезой о принципиальной изменчивости мозговых систем это позволяет понять, почему мы видим зашумленный сигнал. И, что очень важно, позволяет выделить группу реально существующих сигналов и доказать их принадлежность к исследуемому процессу. Сотрудники нашего института Ю.Л. Гоголицин и С.В. Пахомов при моем участии разработали метод анализа единичных предъявлений, позволяющий выделять реальные сигналы и оценивать их значимость. В частности, исследуя импульсную активность нейронных популяций, удавалось выделять группы нейронных реакций при выполнении предъявляемых исследователем задач и посторонние реакции тех же нейронов. Точкой отмечается латентность и амплитуда реального пика в нейронной активности или вызванных потенциалах.
При статистически достоверной реакции импульсной активности эта реакция проявляется в достаточно малом количестве проб. Но это реальные импульсы, реальный сигнал, а не его накопленное значение. Видно, что реакция в вызванных потенциалах существенно более единообразная. Но! Количество сигналов существенно меньше количества проб, то есть далеко не в каждой пробе эта область мозга участвовала в исследуемой деятельности. В этой книге я не ставлю задачу разбора результатов применения метода анализа единичных проб. Принципиально важен факт того, что реальные процессы в мозге в единичных пробах далеки от того, что мы обычно изучаем и получаем в результате усреднения.
В этой ситуации наши методы статистического оценивания результатов и вообще почти все используемые математические методы – это лишь методы отбора. Мы договорились обрабатывать результаты именно так, хотя в ряде случаев возможность применения методов недостаточно доказана. Они нужны не для того, чтобы рассчитать значимость события, а чтобы ко всем исследованиям в данной лаборатории и во всех лабораториях, применяющих данные методы оценивания, отбирать результаты для обсуждения одинаковым образом, то есть исключить субъективный фактор.
Еще не так давно старшие по возрасту физиологи широко пользовались выражением «физиологический глаз = чутье», и это считалось доказательным. Не потому, что они были глупыми. Они просто не успели перестроиться с того времени, когда получались простые и ясные результаты. Но так обстоит дело, когда статистика и другие методы обработки применяются правильно. К сожалению, большое количество исследователей, особенно молодых, часто допускают серьезные ошибки не только методического, но и методологического уровня. Почему молодых? В общем, понятно. Старшее поколение эти методы создавало. Сейчас трудно вспомнить, какие дискуссии буквально гремели в среде физиологов. Поэтому большинство ученых старшего поколения уже прошли период ошибок и разочарований. Они хорошо помнят всю «подлость» статистики.
Молодежь в большинстве, к сожалению, слишком привыкла полагаться на всемогущий ПК. Я обозначу основные их ошибки.
1. Неправильное использование формул во всех дополнительных исследованиях, когда не выполняются предположения, лежащие в их основе.
2. Неучет автокорреляций и пространственных корреляций вплоть до применения заведомо неверных для данного исследования методов. Поэтому и в первом, и в проверочных исследованиях делается одна и та же ошибка; ВСЕ результаты оказываются неверными. Наиболее часто это происходит из-за незнания свойств сигнала и шума.
Даже в анализе электрофизиологической информации очень часто встречаются грубые ошибки, а так как рецензенты тоже не всегда звезды с неба хватают, то статьи с ошибками попадают в журналы. И далее на них ссылаются в качестве доказательства своей правоты другие исследователи. Получается снежный ком. Причем многие следующие статьи подтверждают эти неверные результаты, поскольку совершают те же ошибки.
Экспертами были проанализированы статьи, в аннотациях к которым упоминались поведение, когнитивные функции или визуализация мозга. Установлено, что количество статей с правильными и неправильными результатами практически одинаково (см. таблицу).
Таблица. Экспертная оценка работ в области психофизиологии, опубликованных в ведущих журналах

Мы массово столкнулись с этим еще в 80-х годах, при исследовании импульсной активности нейронных популяций и вызванных потенциалов у человека. У одного из моих друзей в кабинете была стена, обклеенная графиками с прекрасными реакциями, но, увы, недостоверными. Эта важная для электрофизиологии проблема приобрела колоссальное значение при исследованиях с помощью позитронно-эмиссионной, функциональной магнитно-резонансной и компьютерной томографии. Здесь одновременно проверяются тысячи вокселей, причем заведомо неизвестны ни свойства распределения регистрируемого в них сигнала, ни пространственная корреляция. По сути, прямой и ясный метод статистической обработки, применимый во всех случаях, фактически отсутствует. Именно поэтому анализ таких данных довольно громоздок и сложен, что автоматически привело к резкому увеличению числа малограмотных работ. Дело в том, что достаточно мало людей с нетехническим образованием дают себе труд разобраться в том, как устроены эти методы. Но самое кошмарное: они считают, что разобрались.
Недавно я был на семинаре, где молодой специалист начала свой доклад с того, что объясняла аудитории (преимущественно психологам), как устроены ПЭТ и МРТ. Это объяснение было таким, что мне пришлось в конце заседания высказать пожелание, чтобы она, пока не изучит вопрос, никогда бы его не касалась. А понимание того, как устроен прибор (конечно, не технических деталей, а базовых принципов), критически важно не только для корректного использования методов обработки сигнала, но и вообще для понимания результатов. Поэтому практически все ее результаты оказались даже не недостоверными, а просто не результатами. В ответ на замечания был стандартный ответ: у нас не было нужного оборудования, поэтому мы сделали так, как получилось.
Зачем знать, как устроен прибор? Да затем, что нужно понимать, что он может измерить, а что – нет. Некоторые вещи данный прибор не может измерить в принципе. Например, когда мы под руководством Н.П. Бехтеревой начали исследовать феномен творчества, то первые результаты на ПЭТ были довольно скромными. И только проведя ЭЭГ-исследования, мы поняли, что происходила активация всего мозга, которая принципиально не может быть обнаружена на ПЭТ нашими методами. Но мы показали это, только досконально зная детали обработки и получения данных. И таких ошибок достаточно много.
Я не стал бы писать об этом, если бы подобные ситуации в многоканальных ЭЭГ-, ПЭТ-, фМРТ-исследованиях не стали регулярными. И при двадцати одном канале математическая обработка ЭЭГ была достаточно сложной, и ошибки были довольно распространены. Радикальное увеличение количества каналов, повоксельное описание мозга на порядок усложнили эту обработку. Мы все еще вынуждены пользоваться методом накопления и дальнейшего статистического оценивания результатов. Но практически все эффективные методы требуют достаточно жестких ограничений на свойства сигнала, которые, как правило, не выполняются, или же проверить их выполнение довольно трудно.
К сожалению, повторяю, мы не знаем самого главного – статистических свойств сигнала, то есть как статистически связана активность в различных вокселях или на электродах, в какой степени процессы в точке зависят от истории процесса. И так далее. Поэтому необходимо детальное понимание физики и физиологии явления, для того чтобы разобраться, что же мы реально видим. Часто пренебрегают поправками на множественность испытаний, то есть на то, что если мы допускаем 5 % ошибок, то в пяти случаях из ста получим ошибочные активации.
Хорошо известен пример с фМРТ форели, у которой в мозге были обнаружены активации на эмоционально значимые стимулы. Единственный «недостаток» исследования заключался в том, что форель была мертвой! Недавно я был на одном семинаре по фМРТ, где только один(!) доклад не содержал грубых ошибок в обработке материала. И эти доклады были опубликованы в приличных журналах!
Мистификация эмоционального ответа у мертвой форели. (Опубликовано: Journal of Serenditous and Unexpected Results / Журнал случайных и неожиданных результатов. 2010)
Следует, однако, заметить, что за последние десятилетия эти вопросы не только активно обсуждались, но были предложены (и продолжают развиваться) более или менее работающие конкретные методы учета указанных особенностей регистрируемого сигнала.
Ситуация повторяется. Я помню довольно агрессивный спор в нашей лаборатории в середине восьмидесятых. Самописец (тогда у нас не было ничего другого) зарегистрировал маленький пик после предъявления стимула. Получивший этот пик исследователь с пеной у рта доказывал, что это реакция. Ему возражали, что, возможно, это случайность. Тогда он взял линейку, померил высоту пика и сказал: «Какая случайность? Семь миллиметров». В то время большинство исследователей свято верили в силу так называемого глаза физиолога, который запросто отличит артефакт от реакции. «Ну вы же видите этот пик! – Да, но на повторном графике его нет. – Ну и что?»
Сейчас методы статистического оценивания стали неизмеримо более сложными. Для того чтобы их полностью понять, надо быть математиком. Но где же взять столько математиков на подхвате? Поэтому очень многие исследователи применяют пакеты обработки, не очень вдаваясь в то, что делает каждый пакет. И часто, получив в промежутке красивый результат (как с форелью), заканчивают дальнейшую обработку и публикуют его. В результате научная литература буквально наводняется некорректно полученными данными, что попросту обесценивает предлагаемую дальнейшую их интерпретацию, которая при соблюдении всего лишь формальных и довольно несложных правил могла бы внести существенный вклад в понимание изучаемых физиологических процессов.
Приведем данные одного из самых высокорейтинговых журналов. При оценке фМРТ одной из повторяющихся и обескураживающих ошибок является анализ количества вокселей в качестве сравниваемых переменных. Результат такого сравнения не имеет никакой физиологической основы. Такой «феноменологический» анализ получаемых фМРТ-изображений не отражает действительного положения дел. Первое впечатление таково, что «активации» у данного испытуемого в одном и другом речевом тестовом задании вроде как разные. Однако прямая статистическая проверка, которая учитывает статистические свойства сигнала, показывает, что этой разницы нет! А теперь представьте, если мы возьмем 16 таких испытуемых, посчитаем и сравним количество вокселей (так называемую площадь активации) при одном и другом тестовом задании, то, применив любой статистический тест, получим значимую разницу, что попросту не соответствует действительности. Все потому, что мы не учли важных статистических свойств сигнала.
Попробуем разобраться, почему сложилась такая ситуация. Мне кажется, причина – в «обожествлении» ПК. Он все знает. Поэтому достаточно нажать на нужную кнопку – и дело в шляпе. А это, в свою очередь, происходит от низкой квалификации научных работников. Сейчас нам аукается ситуация с массовым отъездом молодежи на Запад в минувшие годы и, будем честны, с резким снижением качества образования в наших университетах. В частности, многие молодые исследователи не умеют применять знания общих законов природы (даже если они их усвоили) в конкретной работе, а также (и это общая беда) они не знают работ своих предшественников, в массе считая, что условно до 2000 года науки вообще не было.
Примеры появляются ежедневно. Из интервью одного профессора, перепечатанное еще и в новостях факультета психологии ВШЭ, озаглавленное «Традиционные представления о восприятии языка неверны». Суть сделанного им «нового открытия» в том, что речевые области, «оказывается», не ограничиваются областями Брока и Вернике. С конца 1980-х трудно найти психофизиолога, который в этом сомневался бы!
Далеко не все, особенно ученые средних способностей, хорошо устроились «там». Сейчас начался обратный процесс. Люди по разным причинам возвращаются. Проблема в том, что на Западе они работали на самых современных приборах, но, как правило, их роль была подчиненной. Они научились нажимать на кнопки и получать сырые данные. Но они считают, что обладают достаточной квалификацией, чтобы учить наших специалистов, которых действительно не хватает, чтобы освоить появившиеся в России в большом количестве новые приборы. Дальнейшее логично. В стране слепых и кривой – король. Кроме этого, есть люди, воспитанные новыми университетами, которые не обременяют себя лишними знаниями, полагая, что не боги горшки обжигают. Интересно, пробовал ли кто-нибудь сделать горшок?
Они получают данные и интерпретируют их с завидной легкостью. У них нет ни культуры организации психофизиологического эксперимента, ни хотя бы поверхностного знания методов обработки. Создание психологического теста или задания – это практически половина исследования, если не больше. При создании теста необходимо досконально знать и особенности прибора, и правила психологического тестирования человека. Но даже в этом умудряются совершать ошибки, которые влияют на интерпретацию результатов.
Например, в одном докладе пытались исследовать достаточно тонкие свойства глаголов. Испытуемому предъявляли картинки, которые изображали соответствующие действия. Например, человек лопатой копает землю – глагол «копать». Но в качестве контроля показывали картинки, изображающие другие глаголы (здесь не место вдаваться в лингвистику). Проблема в том, что некоторые картинки были эротическими (как мне сказала докладчица – «чтобы заинтересовать испытуемого»). Очевидно, что тонкая разница в обработке глаголов совершенно забивалась естественной реакцией.
Многие исследователи не понимают, ЧТО именно они получают в процессе измерения. Дело в том, что карты мозговых реакций, которые мы публикуем, – это карты не реального изменения мозгового кровотока, а распределения вероятности статистически значимого ответа в данном вокселе. Это не физиологический, а математический параметр; правила обращения с ним должны быть совершенно другими.
На упомянутом семинаре лекцию, посвященную принципам МРТ, читал кандидат биологических наук, а методы фМРТ – кандидат психологических наук. А ведь это вопросы, достаточно сложные и математически, и физически; правильно и доступно их может объяснить только человек, имеющий соответствующее образование.
Я не хочу утомлять читателя различными примерами: их число довольно велико и все они вызваны псевдознаниями исследователей. Люди используют сложнейшую технику, совершенно не понимая, что именно они получают. Таким образом, в настоящее время в области нейровизуализации формируются сообщества исследователей, которых Ландау называл «патологами». Они легко организуются в группы. Благодаря, мягко говоря, упрощенным методам обработки и интерпретации, а также практически отсутствию в редколлегиях специалистов по этому новому делу, они довольно плодовиты. Многочисленность и плодовитость приводят к тому, что они, по сути, определяют уровень нашей науки, в то время как действительно серьезные исследования, требующие значительно большего труда и времени, остаются в меньшинстве. У них все просто и легко. Они убеждают чиновников, получают гранты и аппаратуру, с помощью которых расширяются. Это может привести к тому, что отношение к работам из России будет соответствующим, по крайней мере у серьезных ученых. То, что они делают, можно назвать полной профанацией науки и причинением ей тяжких повреждений. Я сознательно опустил конкретные фамилии и названия мероприятий, потому что ситуация приобрела слишком распространенный характер и выделять фамилию какого-либо из самоуверенных дилетантов бессмысленно.
Такое ощущение, что мозг шутя раскрывает свои тайны, полагая, что этих тайн так много, что можно немного «подкинуть» и нам, любопытствующим ученым. Но мы с каждым открытием не просто узнаем новые факты – мы узнаем новые закономерности. Нам (хочется думать) удается пусть немного, но «перехитрить» наш мозг. А это уже путь вперед. Это будет долгий путь…