• Вход в личный кабинет
  • Регистрация

Том 18, номер 3 (2026)

Влияние схем предобработки данных функциональной магнитно-резонансной томографии на точность классификации шизофрении с применением методов машинного обучения

2026, Том 18, номер 3, стр. 14 Назад


Цель исследования — анализ влияния различных процедур подготовки сырых данных функциональной магнитно-резонансной томографии (фМРТ) на точность классификации испытуемых на больных шизофренией и группу контроля с использованием методов машинного обучения, а также формирование рекомендаций по оптимизации схемы предобработки данных для этой задачи.

Материалы и методы. В исследовании используются данные фМРТ 72 испытуемых, полученные на МР-томографе Siemens Magnetom Verio 3 Tл (Siemens Healthineers, Германия) на базе Национального исследовательского центра «Курчатовский институт». Для каждого набора выполняется несколько вариантов предобработки в соответствии с множеством проверяемых схем предобработки данных. В работе исследованы 7 различных схем предобработки. Из каждого набора предобработанных данных формируются вектора признаков для классификации. Мы применяли 3 алгоритма формирования векторов признаков: ReHo, FCM, FHR. Для каждого набора признаков и каждой схемы предобработки проводится классификация с использованием 15 алгоритмов машинного обучения из пакета scikit-learn. Итоговая точность определяется как максимальная точность среди всех методов машинного обучения.

Результаты. Показано, что нет единой оптимальной схемы для всех алгоритмов формирования векторов признаков. Для воксельных метрик ReHo и FHR сглаживание увеличивает точность, в то время как для региональной метрики FCM сглаживание не дает положительных эффектов. Для метода FHR из всех шагов предобработки только пространственное сглаживание влияет на точность классификации. Набор признаков FHR без сглаживания демонстрирует точность, близкую к случайной. Шаги частотной фильтрации и нормализации медианы обеспечивают существенный прирост точности для методов ReHo и FCM, причем как в варианте со сглаживанием, так и без него. Шаги коррекции неоднородности и временнóго смещения не дают прироста точности для набора FCM, однако позволяют повысить ее на несколько процентов для набора ReHo. Применение ICA-фильтрации изменяет точность в пределах 5% как в положительную, так и в отрицательную сторону.

Заключение. На основании полученных результатов можно сформулировать рекомендации по схеме предобработки данных фМРТ для бинарной классификации испытуемых на больных шизофренией и группу контроля с использованием методов машинного обучения и с учетом алгоритма формирования векторов признаков. Для метрики ReHo лучше подходит схема, включающая коррекцию движения, нормализацию, коррекцию неоднородности, коррекцию временнóго смещения, частотную фильтрацию, нормализацию медианы и пространственное сглаживание. Для метрики FCM — схема, включающая коррекцию движения, нормализацию, коррекцию неоднородности, коррекцию временнóго смещения, частотную фильтрацию и нормализацию медианы. Для метрики FHR главное — сделать пространственное сглаживание. Шаг ICA-фильтрации не дает однозначного результата, поэтому его следует применять с осторожностью.

Ключевые слова: классификация шизофрении; предобработка данных; фМРТ; методы машинного обучения.


Введение

В последнее время функциональная магнитно-резонансная томография (фМРТ) все чаще применяется для анализа различных факторов, отражающихся на когнитивных процессах человека (зависимость от курения, склонность к психозу, алкоголизму, голод и т.д.) [1–4]. Одним из актуальных научных направлений является изучение генеза и течения психических расстройств. В рамках данного направления, помимо прочих, решается задача классификации испытуемых по наличию психических расстройств (в частности, шизофрении) с использованием данных фМРТ и с применением методов машинного обучения (опорных векторов, случайного леса и др.) [5–7]. Актуальность этой задачи обусловлена необходимостью выделить объективные биологические маркеры данных заболеваний.

Для формирования векторов признаков в задачах классификации часто используют параметры, основанные на корреляции, частотных характеристиках сигнала, графовых метриках и т.п. Значения этих параметров сильно зависят от этапа подготовки сырых данных фМРТ, часто называемого предобработкой данных и включающего шаги для очистки их от аппаратных и физиологических шумов, а также приведение данных к общему виду для группового анализа (нормализация, гармонизация и т.д.).

Так, например, V.M. Vergara с соавт. [1] изучили влияние некоторых специфических шагов предобработки данных на результаты классификации испытуемых по нескольким признакам (легкая черепно-мозговая травма, наличие вредных привычек — например, курения) с применением метода независимых компонент (independent component analysis, ICA). Главным предметом анализа в схемах предобработки данных является порядок следования двух шагов: коррекции артефактов движения при помощи регрессии и ICA-анализа. Дополнительно рассмотрен вопрос о влиянии на результат параметров шага частотной фильтрации. Результаты показали, что наилучшую точность продемонстрировали схемы, в которых шаг коррекции артефактов движения предшествовал этапу ICA-анализа. Причем различия в точности, связанные с перестановкой порядка следования этих двух шагов в общей схеме предобработки, достигали 5–6%. Варьирование верхнего порога частотной фильтрации показало вариативность точности в пределах 2%.

В исследовании F. Gargouri [8] рассмотрено влияние этапов предобработки данных на графовые метрики, которые часто используются в задачах классификации по данным фМРТ. В статье проанализированы схемы предобработки данных, включающие шаги коррекции фазового сдвига, коррекции артефактов движения, сглаживания фильтром Гаусса с ядром 5 мм, фильтрации независимых компонент (tCompCor), частотной фильтрации с порогами 0,01 и 0,1 Гц. В качестве целевых графовых метрик для анализа выбраны локальная и глобальная эффективность (local efficiency, global efficiency), коэффициент кластеризации (clustering coefficient), плотность (density), длина пути (path length) и др. Тесты проводились на здоровых испытуемых. Результаты показали, что выбор и порядок этапов предварительной обработки данных влияют на графовые метрики. В частности, было показано, что применение шагов сглаживания и tCompCor в качестве заключительных шагов процесса предобработки данных повышает значение глобальной эффективности.

В работе C. Candemir [9] изучено влияние параметров пространственного сглаживания (конкретно размера ядра сглаживания) на характеристики данных фМРТ, рассчитанные с применением теории графов, а также на результаты анализа с применением метода ICA и метода главных компонент (PCA). Показано, что размер ядра пространственного сглаживания влияет на соединения узлов в графе, и это приводит к изменению функциональных структур сети и параметров PCA/ICA. В то же время графовые метрики демонстрируют бо́льшую устойчивость к этим изменениям.

R.C. Sotero и соавт. [10] исследовали влияние шагов частотной фильтрации и регрессии глобального сигнала на точность классификации испытуемых с расстройствами аутистического спектра. Для классификации применяли нейронные сети с архитектурой LSTM (long short-term memory). Установлено, что отсутствие фильтрации обеспечивает более высокую точность классификации, в то время как существенных различий в точности классификации при удалении или отсутствии глобального сигнала не было.

В работе A.M. Triana [11] продемонстрировано влияние пространственного сглаживания на групповые различия между испытуемыми с диагнозами «расстройства аутистического спектра» и «биполярное расстройство». В качестве набора признаков для разделения групп применяли функциональные коннектомы, рассчитанные на регионах атласа Brainnetome. Для оценки различий использовали статистику различий сетей [12]. Было показано, что для функциональных коннектомов, в которых сила связей выражается взвешенной матрицей, увеличение размера ядра увеличивает различия, а для функциональных коннектомов с пороговой матрицей связности увеличение размера ядра уменьшает различия. Авторы пришли к выводу, что эффекты пространственного сглаживания трудно предсказуемы, и это следует учитывать при выборе схемы предобработки данных.

V. Borchardt [13] с соавт. детально изучили влияние трех шагов предобработки (детрендинг, частотная фильтрация, удаление глобального среднего) на разделяемость испытуемых с депрессией и группу контроля на основании матричных и графовых характеристик, рассчитанных на данных фМРТ. По итогам исследования авторы заключили, что предварительная обработка сильно влияет на разделяемость испытуемых. Особенно сильное влияние оказывают удаление глобального среднего, диапазон частотной фильтрации, а также пороговые значения разреживания матрицы связности.

Нам не удалось обнаружить исследований различных методов, схем и алгоритмов предварительной обработки данных в контексте задачи бинарной классификации испытуемых на больных шизофренией и группу контроля с использованием алгоритмов машинного обучения, но из приведенных работ можно предположить, что схемы предобработки являются одним из ключевых моментов успеха классификации. Поэтому целью настоящего исследования являются анализ влияния различных процедур подготовки сырых данных фМРТ на точность классификации испытуемых на больных шизофренией и группу контроля с использованием методов машинного обучения, а также формирование рекомендаций по оптимизации схемы предобработки данных для этой задачи.

Далее будем писать «классификация шизофрении», подразумевая задачу классификации испытуемых на больных шизофренией и группу контроля.

Материалы и методы

Краткий обзор метода. На рис. 1 представлена общая схема эксперимента.

Poida_1.jpg

Рис. 1. Общая схема эксперимента

Сырые данные — это фМРТ-данные 72 испытуемых, полученные на томографе. Для каждого набора выполняется несколько вариантов предобработки в соответствии с множеством проверяемых схем пред­обработки данных. В работе были исследованы 7 различных схем предобработки. За основу взята классическая схема предварительной обработки фМРТ-данных, состоящая из 4 основных этапов.

Из каждого набора предобработанных данных формируются вектора признаков для классификации. Мы применяли 3 алгоритма формирования векторов признаков: ReHo (regional homogeneity) [14], FCM (functional connectome matrix) [15], FHR (functionally homogeneous regions) [16].

Для каждого набора признаков и каждой схемы пред­обработки проводится классификация. В нашей работе классификацию испытуемых осуществляли с использованием 15 алгоритмов машинного обучения из пакета scikit-learn. Итоговую точность определяли как максимальную среди всех методов машинного обучения.

Испытуемые. В исследование включены 36 пациентов (16 женщин и 20 мужчин; средний возраст — 28,9±7,3 года), госпитализированных в общепсихиатрические отделения Психиатрической клинической больницы №1 им. Н.А. Алексеева Департамента здравоохранения г. Москвы в связи с обострением продуктивной симптоматики при шизофрении (диагноз верифицирован согласно критериям рубрики F20 по МКБ-10) в период 2018–2019 гг. Осмотр и обследование пациентов проводились в течение 48 ч после госпитализации в стационар круглосуточного типа двумя врачами-психиатрами с использованием комплексного подхода, который включал клиническую беседу с пациентом, изучение медицинской документации, сбор физикальных и лабораторных данных, оценку психометрических показателей и анамнеза, опрос родственников.

Критерии включения: возрастной диапазон 21–35 лет; подтвержденный диагноз шизофрении в соответствии с МКБ-10; ведущая рука — правая; способность к критической оценке своего состояния; сохранение воспоминаний о психотических эпизодах; подписанное добровольное информированное согласие.

Критерии исключения: лица с органическими поражениями ЦНС, тяжелыми соматоневрологическими патологиями, влияющими на мозговые структуры, а также с историей злоупотребления психоактивными веществами. Дополнительными исключающими факторами стали противопоказания к МРТ-исследованию и отказ от участия.

Контрольную группу сформировали 36 здоровых добровольцев (17 женщин, 19 мужчин; средний возраст — 28,9±6,2 года), не имеющих родственных связей с пациентами. Все участники контрольной группы прошли идентичное клиническое и инструментальное обследование в рамках единого протокола.

Исследование проведено в соответствии с Хельсинкской декларацией (2024) и одобрено локальным этическим комитетом Национального исследовательского центра «Курчатовский институт» (протокол №5 от 05.04.2017 г.)

Получение сырых данных. Регистрацию экспериментальных данных проводили на МР-томографе Siemens Magnetom Verio (Siemens Healthineers, Германия) с напряженностью магнитного поля 3 Tл на базе Национального исследовательского центра «Курчатовский институт». Во время процедуры испытуемым была дана инструкция закрыть глаза, максимально расслабиться и не думать ни о чем конкретном. Для получения фМРТ-данных использовали мультисрезовую эхо-планарную последовательность. Ключевые параметры: 56 срезов, время повторения (TR) — 720 мс, время эха (TE) — 33 мс, поле обзора (FOV) — 192×192 мм, размер воксела — 2×2×2 мм, multiband фактор — 3. Для получения структурной МРТ использовали T1-взвешенную последовательность со следующими параметрами: 176 срезов, TR — 1900 мс, TE — 2,19 мс, толщина среза — 1 мм, угол поворота — 9°, время инверсии — 900 мс, FOV — 250×218 мм. Дополнительно был записан протокол для оценки неоднородности магнитного поля в области сканирования (GRE field mapping) со следующими параметрами: 56 срезов, TR — 470 мс, TE1 — 4,92 мс, TE2 — 7,38 мс, FOV — 192×192 мм, размер воксела — 2×2×2 мм. В рамках исследования отсканировано 900 временны́х отсчетов для функциональных данных общей длительностью порядка 10,5 мин.

Схемы предобработки данных. В работе исследованы 7 различных схем предобработки (14 с учетом шага пространственного сглаживания). За основу была взята классическая схема предварительной обработки фМРТ-данных, состоящая из 4 основных этапов [17]:

1) расчет и коррекция движения головы испытуемого во время сканирования с помощью библиотеки BROCCOLI [18] (5 итераций);

2) коррекция данных на неоднородность магнитного поля в области сканирования;

3) коррекция временнóго смещения сигнала (приведение к сигналу, полученному в момент времени, равный половине значения TR);

4) приведение индивидуальных изображений в атласное пространство MNI (разработанное Монреальским неврологическим институтом).

Пункты 2–4, а также процедура размытия (если применялась) были выполнены в свободно распространяемом программном обеспечении SPM12 [19].

Для улучшения качества получаемых в результате предварительной обработки данных в приведенную выше схему был добавлен шаг удаления немозговых вокселов между 1-м и 2-м этапами схемы. Процедура реализуется на основе рассчитанных из данных вероятностных карт. Вероятностная карта показывает, с какой вероятностью тот или иной воксел принадлежит мозговой или немозговой ткани. Обычно вероятностная карта строится для первого фМРТ-изображения из серии. Затем, определяя порог вероятности (обычно 50%), данная карта бинаризируется и умножается на каждое фМРТ-изображение. Такой подход предполагает полное соответствие всех вокселов в серии изображений. Описанная схема пред­обработки получила название proc123.

Следует отметить, что шаги 1 и 4 из приведенной схемы являются обязательными для всех этапов предварительной обработки. Большинство фМРТ-исследований основаны на обнаружении небольших временны́х изменений BOLD-сигнала, вызванных изменениями уровня оксигенации крови во время активации мозга. Однако в действительности эти изменения являются достаточно небольшими (обычно 1–5% даже при оптимальных условиях и высокой напряженности магнитного поля). Поэтому любые движения головы в пределах 1 мм или поворота на 1 градус могут привести к ложной оценке активации [20]. Кроме того, все последующие этапы обработки данных предполагают стабильность пространственного расположения каждого воксела во времени. В связи с этим от этапа коррекции движений невозможно отказаться в рамках настоящего исследования.

Пространственная нормализация данных является критически важным шагом для группового анализа всего мозга, позволяющим усреднять данные по всем испытуемым. Нормализация мозга, однако, также важна для индивидуальных данных, поскольку она позволяет соотносить наблюдаемые активированные нейрональные сети с атласными регионами в стандартной пространственной системе координат. Нормализация мозга в объемном пространстве обычно выполняется путем искривления каждого индивидуального изображения мозга в общее пространство. После нормализации мозга предполагается, что точка в общем пространстве, определяемая ее координатами (x, y, z), относится к аналогичной области в любом индивидуальном изображении, нормализованном в соответствии с той же процедурой. Наиболее часто используемым целевым пространством для нормализации является пространство MNI и тесно связанное с ним пространство Талаираха [21]. Поскольку классификация данных происходит с учетом регионов из атласного пространства (на основе атласа CONN [22]), данный шаг также является обязательным.

Таким образом, схема предобработки proc1 представляет собой применение только 2 обязательных шагов — коррекции движения и пространственной нормализации. Схема proc12 содержит в себе еще этап коррекции неоднородности магнитного поля [23]. Схема proc123 (классический вариант пред­обработки) отличается от proc12 добавлением этапа коррекции временнóго смещения сигнала. Схема proc1234 получается путем добавления полосной частотной фильтрации в физиологическом диапазоне, а также нормализации медианной интенсивности в наборе данных. Значение средней интенсивности, рассчитанной по всем вокселам, нормируется на определенное значение. Этот шаг позволяет эффективно устранить любые средние глобальные различия в интенсивности между записями различных испытуемых. Такая процедура нормирования значений имеет большой смысл при обработке фМРТ-данных, поскольку различия между наборами данных могут быть существенными. Ее выполнение на первом (внутрисубъектном) уровне позволяет устранить различия между испытуемыми. И наконец, схема proc12345 получается путем применения метода ICA для подавления шумов на данных, полученных после применения схемы proc1234. Метод ICA является мощным инструментом для слепого разделения источников сигнала. В ЭЭГ этот метод широко применяется для детекции и удаления глазодвигательных артефактов. По аналогии с ЭЭГ ICA может быть применен к фМРТ-данным с целью обнаружения и удаления артефактов. В результате применения ICA фМРТ-данные могут быть представлены в виде трехмерных пространственных карт и соответствующих им временны́х рядов [24]. Анализ пространственной локализации компоненты и ее временнóй динамики позволяет проводить детекцию шумовых компонент. Для удаления шумовых компонент использовали программу на основе нейронных сетей, написанную авторами статьи.

Еще 2 схемы предварительной обработки данных появились в результате анализа данных точности бинарной классификации шизофрении по описанным выше схемам. Как оказалось, этапы коррекции неоднородности и коррекции временнóго смещения не оказывали существенного положительного влияния на точность. В связи с этим данные были дополнительно обработаны по схемам:

proc14 — коррекция движения, пространственная нормализация, частотная фильтрация и нормализация медианы;

proc145 — применение ICA к данным, полученным в результате обработки по схеме proc14.

Во всех описанных выше схемах финальным шагом применяется пространственная нормализация.

Для всех описанных схем предварительной обработки данных также были добавлены дублирующие схемы, в которых последним этапом дополнительно проводилось пространственное сглаживание данных фильтром Гаусса с ядром 6×6×6 мм.

Для наглядности схемы предобработки данных и их краткие описания приведены на рис. 2. Каждую схему завершает шаг пространственной нормализации (на схеме не указан).

Poida_2.jpg

Рис. 2. Анализируемые схемы предобработки данных функциональной магнитно-резонансной томографии. Для каждой схемы есть ее дубль, завершающийся шагом пространственного сглаживания

Формирование векторов признаков. В работе мы проверили три алгоритма формирования векторов признаков.

Метод локальной однородности (ReHo) [14] основывается на расчете коэффициента соответствия Кендалла каждого воксела со своими ближайшими соседями. В данном исследовании мы использовали 26 соседних вокселов. Для уменьшения размерности полученную воксельную метрику мы усреднили по регионам атласа CONN. В результате для каждого испытуемого вектор признаков включал 132 значения (по числу регионов атласа CONN). Для расчета значений ReHo использовали программный пакет BRANT v. 3.36 [25].

Метод, который формирует корреляционные матрицы связи регионов головного мозга, часто называется в литературе функциональным коннектомом (FCM) [15]. Суть метода сводится к усреднению динамик вокселов по регионам анатомического атласа (мы использовали атлас CONN) с последующим расчетом корреляционной матрицы между полученными динамиками регионов. Таким образом, для каждого испытуемого формируется матрица размером 132×132, но в силу ее симметричности для классификации используются только значения над или под главной диагональю (всего 132·131/2=8646 значений). Для расчета значений FCM мы использовали свой код. Корреляционную матрицу считали на основе корреляции Пирсона.

Ранее разработанный метод функциональной однородности (FHR) [16] заключается в расчете для каждого воксела размера его зоны однородности (связанной области вокруг воксела, состоящей из вокселов, коррелирующих с данными выше заданного порога). Из-за высокой зависимости результата метода от скоррелированности данных для этого метода проведены дополнительные предобработки данных — повоксельное удаление автокорреляции с помощью авторегрессии первого и второго порядка и удаление глобальной составляющей сигнала посредством линейной регрессии. В данном исследовании порог был выбран 0,5, так как предыдущие исследования [26] показали, что при этом пороге достигается наибольшая точность классификации. Для уменьшения размерности полученную воксельную метрику мы усреднили по регионам атласа CONN, получив вектор из 132 значений. Для расчета FHR использовали код с сайта GitHub [27].

Мы выбрали для анализа методы ReHo и FCM, потому что они хорошо зарекомендовали себя в работах по автоматической классификации шизофрении по данным фМРТ. В то же время эти методы существенно различаются между собой по признаку масштаба: ReHo — это метрика, рассчитываемая в каждом вокселе, в то время как FCM — на масштабах целых регионов. Метод FHR мы выбрали, потому что он хорошо показал себя при выделении малого числа наиболее информативных признаков для классификации шизофрении [28]. Аналогично методу ReHo метод FHR рассчитывается на масштабе отдельных вокселов.

Классификация. Классификацию испытуемых проводили с использованием 15 алгоритмов машинного обучения из пакета scikit-learn [29]: SVC (с ядром RBF), SVC (с линейным ядром и увеличенной регуляризацией), NuSVC, LinearSVC, SGDClassifier, Perceptron, PassiveAggressiveClassifier, MLPClassifier, LogisticRegression, Logistic­Regres­sionCV, RandomForestClassifier, ExtraTreesClassifier, RidgeClassifier, RidgeClassifierCV, KNeighborsClassifier.

Так как набор собран всего по 72 испытуемым, то расчет точности для каждого алгоритма машинного обучения производился по методу перекрестной проверки на основе повторяющихся случайных разбиений (метод ShuffleSplit) [30]. Такой метод используется при небольшом количестве исходных данных с целью получения более точного результата. На каждой итерации цикла перекрестной проверки 72 участника эксперимента делились случайным образом на обучающую выборку (64 набора) и проверочную (8 наборов). Важное условие — в проверочной выборке должны быть наборы из обоих классов. На обучающей выборке проводилось обучение классификатора, точность которого затем вычислялась на проверочной выборке. Мы использовали 1000 итераций цикла перекрестной проверки для каждого варианта обработки данных, рассчитывая результирующую точность по формуле:

Poyda_formula.jpg

где n — число итераций (в нашем случае 1000); TP и TN — число истинно-положительных и истинно-отрицательных результатов в каждой итерации цикла перекрестной проверки соответственно; FN и FP — число ложноотрицательных и ложноположительных результатов в каждой итерации цикла перекрестной проверки соответственно. Индекс i соответствует номеру итерации.

Итоговая точность определялась как максимальная точность среди всех методов машинного обучения.

Результаты

Результаты влияния предобработки данных фМРТ на точность классификации шизофрении с использованием алгоритмов машинного обучения представлены в табл. 1 и 2.

Таблица 1. Влияние предобработки данных функциональной магнитно-резонансной томографии на точность классификации шизофрении с использованием алгоритмов машинного обучения (без сглаживания)

Уровень предобработки

ReHo

FCM

FHR

proc1

0,64

0,64

0,62

proc12

0,58

0,65

0,54

proc123

0,59

0,64

0,52

proc1234

0,68

0,81

0,55

proc14

0,65

0,77

0,64

proc12345

0,64

0,77

0,61

proc145

0,62

0,79

0,63

Таблица 2. Влияние предобработки данных функциональной магнитно-резонансной томографии на точность классификации шизофрении с использованием алгоритмов машинного обучения (со сглаживанием)

Уровень предобработки

ReHo

FCM

FHR

proc1

0,64

0,65

0,74

proc12

0,62

0,64

0,74

proc123

0,61

0,65

0,71

proc1234

0,76

0,78

0,72

proc14

0,73

0,80

0,75

proc12345

0,73

0,80

0,72

proc145

0,75

0,81

0,78

Из полученных результатов можно сделать следующие выводы.

Для задачи бинарной классификации шизофрении по данным фМРТ в состоянии покоя с применением алгоритмов машинного обучения выбор схемы предобработки может изменять точность классификации более чем на 20% (в зависимости от метода формирования векторов признаков). Так, для метода ReHo минимальная точность составляет 58%, в то время как максимальная — 76%; для метода FCM — 64 и 81% соответственно; для FHR — 52 и 78% соответственно.

Нет единой оптимальной схемы для всех алгоритмов формирования векторов признаков (FCM, ReHo, FHR).

Для воксельных метрик ReHo и FHR сглаживание увеличивает точность (в некоторых случаях более чем на 10%), в то время как для региональной метрики FCM сглаживание не дало столь значительного улучшения (максимальная разница 3%). Это может быть связано с тем, что на воксельном уровне сглаживание нивелирует шумовые выбросы в отдельных вокселах. Что касается региональной метрики FCM, то при ее расчете данные изначально усредняются по регионам, и это в свою очередь является эквивалентом сглаживания в воксельных метриках.

Для метода FHR из всех шагов предобработки только пространственное сглаживание значительно влияет на точность классификации. Набор признаков FHR без сглаживания дает точность, близкую к случайной.

Шаг 4 дает существенный прирост точности для методов ReHo и FCM, причем как в варианте со сглаживанием, так и без него. Максимальный прирост показал, что FCM при переходе от схемы proc123 к схеме proc1234 в варианте без сглаживания составил 17%.

Сравнивая точность схем FCM и ReHo, которые включают шаги 2 и 3 с аналогичными схемами без данных шагов, можно сделать вывод, что наличие шагов 2 и 3 не дает устойчивого увеличения точности классификации: прирост точности за счет добавления этих шагов варьируется от –5% до +3%.

Применение ICA-фильтрации (шаг 5) изменяет точность в пределах 5%, но может работать как в одну, так и в другую сторону, что не позволяет сделать однозначного вывода о необходимости ее применения.

Обсуждение

За последнее десятилетие было опубликовано большое количество работ [1, 8, 9, 11–13], описывающих обработку временны́х рядов фМРТ. Была проверена огромная масса шагов предварительной обработки, определены минимально необходимые, выяснено наиболее оптимальное их расположение в общей схеме обработки. Однако полученные выводы опирались на аналитический анализ качества результирующих данных и результаты статистического картирования, проведенного после предварительной обработки. В рамках настоящего исследования было выдвинуто и проверено предположение, что наиболее оптимальная с точки зрения метрик качества и статистического анализа схема предварительной обработки данных может не давать наилучшую точность в задаче бинарной классификации шизофрении. В целом можно отметить, что предварительная обработка данных по классической схеме (в статье — proc123) не позволила получить точность выше 65% по всем рассматриваемым метрикам. Наилучший результат показали данные, которые были предобработаны с учетом полосной фильтрации и нормализации интенсивности. Утверждение о важности шага частотной фильтрации согласуется с работой [13], в которой показано, что правильный выбор порога фильтрации существенно улучшает разделяемость на группу испытуемых с клинической депрессией и группу контроля при использовании матричных и графовых характеристик, рассчитанных на основе FCM.

Таким образом, набор шагов предобработки и порядок их следования должны определяться конкретной задачей, а набор методов, реализующих выбранные шаги, и набор параметров этих методов может стать предметом исследования.

Следует отдельно выделить метод FHR, точность которого преимущественно зависит только от шага пространственного сглаживания. Сравнивая точность в табл. 2, можно видеть, что метод FHR опережает все другие методы до проведения шага частотной фильтрации и нормализации медианы. Даже после проведения этих шагов точность, полученная на наборе FHR, не сильно уступает точности, полученной на других наборах. Это важно, так как позволяет быстро ввести новые данные в анализ, в то время как полный цикл предобработки (до шагов 4 и 5) занимает много времени, в том числе с привлечением ручного труда эксперта. В то же время пространственное сглаживание не требует больших временны́х затрат.

Проведенные исследования имеют ряд ограничений. Во-первых, работа выполнена на фМРТ-данных, полученных с одного томографа и по единому протоколу сканирования. В то же время в недавних исследованиях показано, что точность классификации когнитивных расстройств по данным фМРТ может зависеть от конкретного набора данных [31], т.е. как от томографа, на котором проводится сканирование, так и от параметров самого сканирования. Логично предположить, что и предобработка может оказывать разное влияние на различные наборы данных.

Во-вторых, в исследовании проверяются только несколько схем, построенных на базе классической схемы предварительной обработки фМРТ-данных [17]. Таким образом, ряд алгоритмов и методов пред­обработки (например, регрессия глобального сигнала) остались за рамками данной статьи.

В-третьих, в работе комбинируются шаги пред­обработки данных, но не рассматриваются параметры этих шагов. Например, мы используем пространственное сглаживание с ядром Гаусса 6 мм, не рассматривая другие размеры.

В качестве направления дальнейших работ предлагается зафиксировать схему предобработки данных и оптимизировать параметры шагов, входящих в выбранную схему.

Заключение

Для задачи бинарной классификации шизофрении по данным фМРТ в состоянии покоя с применением алгоритмов машинного обучения выбор схемы предобработки может изменять точность классификации более чем на 20% (в зависимости от метода формирования векторов признаков).

Для разных алгоритмов формирования векторов признаков нет общей оптимальной схемы предобработки данных.

На основании полученных результатов можно сформулировать рекомендации по схеме предобработки данных фМРТ для бинарной классификации шизофрении с учетом алгоритма формирования векторов признаков.

Для метрики ReHo лучше подходит схема, включающая коррекцию движения, пространственную нормализацию, коррекцию неоднородности, коррекцию временнóго смещения, частотную фильтрацию, нормализацию медианы и пространственное сглаживание.

Для метрики FCM лучше подходит схема, включающая коррекцию движения, пространственную нормализацию, коррекцию неоднородности, коррекцию временнóго смещения, частотную фильтрацию и нормализацию медианы.

Для метрики FHR главное — сделать пространственное сглаживание.

Шаг ICA-фильтрации не дает однозначной выгоды, поэтому его следует применять с осторожностью.

Финансирование. Работа выполнена в рамках государственного задания НИЦ «Курчатовский институт».

Конфликт интересов отсутствует.



Литература

  1. Vergara V.M., Mayer A.R., Damaraju E., Hutchison K., Calhoun V.D. The effect of preprocessing pipelines in subject classification and detection of abnormal resting state functional network connectivity using group ICA. Neuroimage 2017; 145(Pt B): 365–376, https://doi.org/10.1016/j.neuroimage.2016.03.038.

  2. González-Vivas C., García-Martí G., Soldevila-Matías P., Sanz-Requena R., Aguilar E.J., Castro-Bleda M.J., Martí-Bonmatí L., Sanjuan J. First-episode psychotic patients showed longitudinal brain changes using fMRI with an emotional auditory paradigm. Front Psychiatry 2020; 11: 593042, https://doi.org/10.3389/fpsyt.2020.593042.

  3. Guggenmos M., Schmack K., Veer I.M., Lett T., Sekutowicz M., Sebold M., Garbusow M., Sommer C., Wittchen H.U., Zimmermann U.S., Smolka M.N., Walter H., Heinz A., Sterzer P. A multimodal neuroimaging classifier for alcohol dependence. Sci Rep 2020; 10(1): 298, https://doi.org/10.1038/s41598-019-56923-9.

  4. Al-Zubaidi A., Mertins A., Heldmann M., Jauch-Chara K., Münte T.F. Machine learning based classification of resting-state fMRI features exemplified by metabolic state (hunger/satiety). Front Hum Neurosci 2019; 13: 164, https://doi.org/10.3389/fnhum.2019.00164.

  5. Moghimi P., Lim K.O., Netoff T.I. Data driven classification using fMRI network measures: application to schizophrenia. Front Neuroinform 2018; 12: 71, https://doi.org/10.3389/fninf.2018.00071.

  6. Zhu W., Wang Z., Yu M., Zhang X., Zhang Z. Using support vector machine to explore the difference of function connection between deficit and non-deficit schizophrenia based on gray matter volume. Front Neurosci 2023; 17: 1132607, https://doi.org/10.3389/fnins.2023.1132607.

  7. Salvador R., Canales-Rodríguez E., Guerrero-Pedraza A., Sarró S., Tordesillas-Gutiérrez D., Maristany T., Crespo-Facorro B., McKenna P., Pomarol-Clotet E. Multimodal integration of brain images for MRI-based diagnosis in schizophrenia. Front Neurosci 2019; 13: 1203, https://doi.org/10.3389/fnins.2019.01203.

  8. Gargouri F., Kallel F., Delphine S., Ben Hamida A., Lehéricy S., Valabregue R. The influence of preprocessing steps on graph theory measures derived from resting state fMRI. Front Comput Neurosci 2018; 12: 8, https://doi.org/10.3389/fncom.2018.00008.

  9. Candemir C. Spatial smoothing effect on group-level functional connectivity during resting and task-based fMRI. Sensors (Basel) 2023; 23(13): 5866, https://doi.org/10.3390/s23135866.

  10. Sotero R.C., Sanchez-Bornot J.M., Shaharabi-Farahani I., Iturria-Medina Y. Examining the impact of fMRI preprocessing steps on machine learning-based classification of autism spectrum disorder. In: 2023 the 7th International Conference on Medical and Health Informatics (ICMHI). New York; 2023; p. 19–24, https://doi.org/10.1145/3608298.3608302.

  11. Triana A.M., Glerean E., Saramäki J., Korhonen O. Effects of spatial smoothing on group-level differences in functional brain networks. Netw Neurosci 2020; 4(3): 556–574, https://doi.org/10.1162/netn_a_00132.

  12. Zalesky A., Fornito A., Bullmore E.T. Network-based statistic: identifying differences in brain networks. Neuroimage 2010; 53(4): 1197–1207, https://doi.org/10.1016/j.neuroimage.2010.06.041.

  13. Borchardt V., Lord A.R., Li M., van der Meer J., Heinze H.J., Bogerts B., Breakspear M., Walter M. Preprocessing strategy influences graph-based exploration of altered functional networks in major depression. Hum Brain Mapp 2016; 37(4): 1422–1442, https://doi.org/10.1002/hbm.23111.

  14. Zang Y., Jiang T., Lu Y., He Y., Tian L. Regional homogeneity approach to fMRI data analysis. Neuroimage 2004; 22(1): 394–400, https://doi.org/10.1016/j.neuroimage.2003.12.030.

  15. Blinowska K.J. Review of the methods of determination of directed connectivity from multichannel data. Med Biol Eng Comput 2011; 49(5): 521–529, https://doi.org/10.1007/s11517-011-0739-x.

  16. Kozlov S., Poyda A., Orlov V., Sharaev M., Ushakov V. Selection of functionally homogeneous human brain regions for functional connectomes building based on fMRI data. In: Velichkovsky B.M., Balaban P.M., Ushakov V.L. (editors). Advances in Cognitive Research, Artificial Intelligence and Neuroinformatics. Intercognsci 2020. Advances in Intelligent Systems and Computing, vol 1358. Springer, Cham; 2021, https://doi.org/10.1007/978-3-030-71637-0_82.

  17. Strother S.C. Evaluating fMRI preprocessing pipelines. IEEE Eng Med Biol Mag 2006; 25(2): 27–41, https://doi.org/10.1109/memb.2006.1607667.

  18. Eklund A., Dufort P., Villani M., Laconte S. BROCCOLI: software for fast fMRI analysis on many-core CPUs and GPUs. Front Neuroinform 2014; 8: 24, https://doi.org/10.3389/fninf.2014.00024.

  19. Ashburner J., Barnes G., Chen C.-C., Daunizeau J., Flandin G., Friston K., Gitelman D., Glauche V., Henson R., Hutton C., Jafarian A., Kiebel S., Kilner J., Litvak V., Mattout J., Moran R., Penny W., Phillips C., Razi A., Stephan K., Tak S., Tyrer A., Zeidman P. SPM12 manual. URL: https://www.fil.ion.ucl.ac.uk/spm/doc/spm12_manual.pdf.

  20. Friston K.J., Williams S., Howard R., Frackowiak R.S., Turner R. Movement-related effects in fMRI time-series. Magn Reson Med 1996; 35(3): 346–355. https://doi.org/10.1002/mrm.1910350312.

  21. Frost M.A., Goebel R. Measuring structural-functional correspondence: spatial variability of specialised brain regions after macro-anatomical alignment. Neuroimage 2012; 59(2): 1369–1381, https://doi.org/10.1016/j.neuroimage.2011.08.035.

  22. Whitfield-Gabrieli S., Nieto-Castanon A. CONN: a functional connectivity toolbox for correlated and anticorrelated brain networks. Brain Connect 2012; 2(3): 125–141, https://doi.org/10.1089/brain.2012.0073.

  23. Togo H., Rokicki J., Yoshinaga K., Hisatsune T., Matsuda H., Haga N., Hanakawa T. Effects of field-map distortion correction on resting state functional connectivity MRI. Front Neurosci 2017; 11: 656, https://doi.org/10.3389/fnins.2017.00656.

  24. Beckmann C.F., Smith S.M. Probabilistic independent component analysis for functional magnetic resonance imaging. IEEE Trans Med Imaging 2004; 23(2): 137–152, https://doi.org/10.1109/TMI.2003.822821.

  25. Xu K., Liu Y., Zhan Y., Ren J., Jiang T. BRANT: a versatile and extendable resting-state fMRI toolkit. Front Neuroinform 2018; 12: 52, https://doi.org/10.3389/fninf.2018.00052.

  26. Козлов С.О. Картирование функциональной активности головного мозга человека с учетом уровня синхронизации вокселей по данным фМРТ. Дисс. ... канд. физ.-мат. наук. М; 2025; 129 с.

  27. GitHub, Inc. KozlovStanislav/CCM-FOR. Korrelyatsionno-klasternye metody vydeleniya funktsional'no-odnorodnykh regionov golovnogo mozga [Selection of functionally homogeneous brain regions based on correlation-clustering analysis]. URL: https://github.com/KozlovStanislav/CCM-FOR.

  28. Жемчужников А.Д., Карташов С.И., Козлов С.О., Орлов В.А., Пойда А.А., Захарова Н.В., Бравве Л.В., Мамедова Г.Ш., Кайдан М.А. Поиск наиболее информативных регионов для бинарной классификации шизофрении по данным фМРТ состояния покоя на основе метода выделения функционально однородных регионов. Журнал высшей нервной деятельности им. И.П. Павлова 2024; 74(4): 412-425, https://doi.org/10.31857/S0044467724040035.

  29. Pedregosa F., Varoquaux G., Gramfort A., Michel V., Thirion B., Grisel O., Blondel M., Prettenhofer P., Weiss R., Dubourg V., Vanderplas J., Passos A., Cournapeau D., Brucher M., Perrot M., Duchesnay É. Scikit-learn: machine learning in Python. Journal of Machine Learning Research 2011; 12: 2825–2830.

  30. Arlot S., Celisse A. A survey of cross-validation procedures for model selection. Statistics Surveys 2010; 4, https://doi.org/10.1214/09-ss054.

  31. Cai X.L., Xie D.J., Madsen K.H., Wang Y.M., Bögemann S.A., Cheung E.F.C., Møller A., Chan R.C.K. Generalizability of machine learning for classification of schizophrenia based on resting-state functional MRI data. Hum Brain Mapp 2020; 41(1): 172–184, https://doi.org/10.1002/hbm.24797.