• Вход в личный кабинет
  • Регистрация
Интеграция архитектуры на основе трансформеров и больших языковых моделей для анализа данных оптической когерентной томографии с целью повышения точности дифференциальной диагностики заболеваний сетчатки
Интеграция архитектуры на основе трансформеров и больших языковых моделей для анализа данных оптической когерентной томографии с целью повышения точности дифференциальной диагностики заболеваний сетчатки

Ключевые слова: классификация биомаркеров ОКТ; мультиклассовая классификация ОКТ; LLM в офтальмологиии; глубокое обучение; сетчатка; ViT; DeepSeek.

2026, Том 18, номер 3, стр. 5
Полный текст статьи: HTML PDF
286
127
  • Аннотация
  • Список литературы
  • Как цитировать в References

Цель настоящего исследования — повышение точности дифференциальной диагностики заболеваний сетчатки с помощью совместного использования трансформерной модели для классификации биомаркеров на ОКТ-изображениях и большой языковой модели DeepSeek-V3.

Материалы и методы. Нами были собраны и размечены два набора данных: тренировочный (3288 ОКТ-изображений центральной зоны сетчатки, размеченных по 8 биомаркерам) и валидационный (50 клинических случаев с сайта octcases.com). Для классификации биомаркеров сравнивали архитектуры ResNet, DenseNet, EfficientNet и Vision Transformer (ViT-Tiny-Patch16-224). Наибольшую эффективность показала модель ViT-Tiny с метриками F1 macro — 0,84±0,03. Разработан алгоритм интеграции полученных меток с данными клинического анамнеза через API-интерфейс LLM DeepSeek-V3.

Результаты. Комбинация ОКТ-биомаркеров и анамнеза повысила диагностическую точность: Top-1 Accuracy — 78%, Top-3 Accuracy — 94%, MRR — 84%, что на 10–44% выше, чем при использовании одного типа данных.

Заключение. Предложенный интегрированный подход позволяет автоматизировать выявление биомаркеров на ОКТ-изображениях и повысить точность дифференциальной диагностики заболеваний глаз, обеспечивая снижение времени интерпретации снимков и поддержку клинических решений.

  1. Sitnova A.V., Valitov E.R., Svetozarskiy S.N. Application of deep learning algorithms based on the multilayer Y0L0v8 neural network to identify fungal keratitis. Sovremennye tehnologii v medicine 2024; 16(4): 5–13, https://doi.org/10.17691/stm2024.16.4.01.

  2. Глизница П.В., Тахчиди Х.П., Светозарский С.Н., Бурсов А.И., Шустерзон К.А. Машинное обучение в диагностике и лечении офтальмологических заболеваний. Head and Neck 2022; 10(1): 83–90.

  3. Takhchidi K., Gliznitsa P., Svetozarskiy S., Bursov A., Shusterzon K. Labelling of data on fundus color pictures used to train a deep learning model enhances its macular pathology recognition capabilities. Bulletin of Russian State Medical University 2021; 2021(4), https://doi.org/10.24075/brsmu.2021.040.

  4. Bahir D., Zur O., Attal L., Nujeidat Z., Knaanie A., Pikkel J., Mimouni M., Plopsky G. Gemini AI vs. ChatGPT: a comprehensive examination alongside ophthalmology residents in medical knowledge. Graefes Arch Clin Exp Ophthalmol 2025; 263(2): 527–536, https://doi.org/10.1007/s00417-024-06625-4.

  5. Mullappilly S.S., Kurpath M.I., Pieri S., Alseiari S.Y., Cholakkal S., Aldahmani K.M., Khan F.S., Anwer R.M., Khan S., Baldwin T., Cholakkal H. BiMediX2: Bio-Medical EXpert LMM for diverse medical modalities. In: Findings of the Association for Computational Linguistics: EMNLP 2025. 2025; p. 14051–14071, https://doi.org/10.18653/v1/2025.findings-emnlp.756.

  6. Gao J., Li C., Liu H., Naumann T., Poon H., Usuyama N., Wong C., Yang J., Zhang S. LLaVA-Med: training a large language-and-vision assistant for biomedicine in one day. In: Advances in Neural Information Processing Systems 36. 2023; p. 28541–28564, https://doi.org/10.52202/075280-1240.

  7. Zhou J., He X., Sun L., Xu J., Chen X., Chu Y., Zhou L., Liao X., Zhang B., Gao X. SkinGPT-4: an interactive dermatology diagnostic system with visual large language model. medRxiv 2023. URL: https://www.medrxiv.org/content/10.1101/2023.06.10.23291127v1.

  8. Аветисов С.Э., Кац М.В. Использование оптической когерентной томографии в диагностике заболеваний сетчатки (обзор литературы). Universum: медицина и фармакология 2017; 4(38). URL: http://7universum.com/ru/med/archive/item/4561.

  9. Pandya B.U., Grinton M., Mandelcorn E.D., Felfeli T. Retinal optical coherence tomography imaging biomarkers: a review of the literature. Retina 2024; 44(3): 369–380, https://doi.org/10.1097/IAE.0000000000003974.

  10. Yang M., Du J., Lv R. CRAT: advanced transformer-based deep learning algorithms in OCT image classification. Biomedical Signal Processing and Control 2025; 104: 107544, https://doi.org/10.1016/j.bspc.2025.107544.

  11. Wang X., Tang F., Chen H., Luo L., Tang Z., Ran A.R., Cheung C.Y., Heng P.A. UD-MIL: uncertainty-driven deep multiple instance learning for OCT image classification. IEEE J Biomed Health Inform 2020; 24(12): 3431–3442, https://doi.org/10.1109/JBHI.2020.2983730.

  12. Üzen H., Fırat H., Alperen Özçelik S.T., Yusufoğlu E., Çiçek İ.B., Şengür A. Central serous retinopathy classification with deep learning-based multilevel feature extraction from optical coherence tomography images. Optics & Laser Technology 2025; 184: 112519, https://doi.org/10.1016/j.optlastec.2025.112519.

  13. Khudhur A.M. Optical coherence tomography retinal classification using deep neural network. J Opt 2025, https://doi.org/10.1007/s12596-025-02561-6.

  14. Abbas Y., Hadi H.J., Aziz K., Ahmed N., Akhtar M.U., Alshara M.A., Chakrabarti P. Reinforcement-based leveraging transfer learning for multiclass optical coherence tomography images classification. Sci Rep 2025; 15(1): 6193, https://doi.org/10.1038/s41598-025-89831-2.

  15. Diao S., Su J., Yang C., Zhu W., Xiang D., Chen X., Peng Q., Shi F. Classification and segmentation of OCT images for age-related macular degeneration based on dual guidance networks. Biomedical Signal Processing and Control 2023; 84: 104810, https://doi.org/10.1016/j.bspc.2023.104810.

  16. Hamid L., Elnokrashy A., Abdelhay E.H., Abdelsalam M.M. A deep learning LSTM-based approach for AMD classification using OCT images. Neural Computing and Applications 2024; 36(31): 19531–19547, https://doi.org/10.1007/s00521-024-10149-7.

  17. Каталевская Е.А., Сизов А.Ю., Гилемзянова Л.И. Алгоритм искусственного интеллекта для сегментации патологических структур на сканах оптической когерентной томографии сетчатки глаза. Российский журнал телемедицины и электронного здравоохранения 2022; 8(3): 21–27, https://doi.org/10.29188/2712-9217-2022-8-3-21-27.

  18. Salehi A., Lee G.C., Ren H., Yu S., Singh R., Talcott K., Melo A., Greenlee T., Chen E., Conti T., Manivannan N. Multi-pathology classification of retinal OCT scans. Investigative Ophthalmology & Visual Science 2023; 64: 1086.

  19. Арзамасцев А.А., Фабрикантов О.Л., Кулагина Е.В., Зенкова Н.А. Классификация снимков оптической когерентной томографии с использованием методов глубокого машинного обучения. Digital Diagnostics 2024; 5(1): 5–16, https://doi.org/10.17816/DD623801.

  20. Kulyabin M., Zhdanov A., Pershin A., Sokolov G., Nikiforova A., Ronkin M., Borisov V., Maier A. Segment anything in optical coherence tomography: SAM 2 for volumetric segmentation of retinal biomarkers. Bioengineering 2024; 11(9): 940, https://doi.org/10.3390/bioengineering11090940.

  21. Gholami P., Roy P., Parthasarathy M.K., Lakshminarayanan V. OCTID: optical coherence tomography image database. Computers & Electrical Engineering 2020; 81: 106532, https://doi.org/10.1016/j.compeleceng.2019.106532.

  22. Kulyabin M., Zhdanov A., Nikiforova A., Stepichev A., Kuznetsova A., Ronkin M., Borisov V., Bogachev A., Korotkich S., Constable P.A., Maier A. OCTDL: optical coherence tomography dataset for image-based deep learning methods. Sci Data 2024; 11(1): 365, https://doi.org/10.1038/s41597-024-03182-7.

  23. Yamauchi T. Spatial sensitive Grad-CAM++: improved visual explanation for object detectors via weighted combination of gradient map. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops. 2024; p. 8164–8168.

Konshina O.V., Pershin A.D., Kulyabin M.K., Borisov V.I. Integration of transformer-based architecture and large language models for optical coherence tomography data analysis to improve the accuracy of differential diagnosis of retinal diseases. Sovremennye tehnologii v medicine 2026; 18(3): 5, https://doi.org/10.17691/stm2026.18.3.01