<?xml version='1.0' encoding='utf-8'?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.2 20190208//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
<article article-type="research-article" dtd-version="1.2" xml:lang="ru" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink"><front><journal-meta><journal-id journal-id-type="issn">2518-1092</journal-id><journal-title-group><journal-title>Научный результат. Информационные технологии</journal-title></journal-title-group><issn pub-type="epub">2518-1092</issn></journal-meta><article-meta><article-id pub-id-type="doi">10.18413/2518-1092-2026-11-3-0-6</article-id><article-id pub-id-type="publisher-id">4359</article-id><article-categories><subj-group subj-group-type="heading"><subject>ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ И ПРИНЯТИЕ РЕШЕНИЙ</subject></subj-group></article-categories><title-group><article-title>&lt;strong&gt;ОЦЕНКА ВАЛИДНОСТИ ОБЩЕДОСТУПНЫХ НАБОРОВ ДАННЫХ МРТ ДЛЯ НЕЙРООНКОЛОГИЧЕСКОГО ОБНАРУЖЕНИЯ АНОМАЛИЙ: ВЫЯВЛЕНИЕ КРИТИЧЕСКИХ ПРОБЛЕМ КАЧЕСТВА ДАННЫХ&lt;/strong&gt;</article-title><trans-title-group xml:lang="en"><trans-title>&lt;strong&gt;VALIDITY ASSESSMENT OF PUBLIC MRI DATASETS FOR NEURO-ONCOLOGICAL ABNORMALITY DETECTION: UNCOVERING CRITICAL DATA QUALITY ISSUES&lt;/strong&gt;</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Низамли</surname><given-names>Яссер</given-names></name><name xml:lang="en"><surname>Nizamli</surname><given-names>Yasser</given-names></name></name-alternatives><email>yanizamli@stud.etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Филатов</surname><given-names>Антон Юрьевич</given-names></name><name xml:lang="en"><surname>Filatov</surname><given-names>Anton Yuryevich</given-names></name></name-alternatives><email>aifilatov@etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Фадел</surname><given-names>Веаам</given-names></name><name xml:lang="en"><surname>Fadel</surname><given-names>Weaam</given-names></name></name-alternatives><email>vfadel@stud.etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Шичкина</surname><given-names>Юлия Александровна</given-names></name><name xml:lang="en"><surname>Shichkina</surname><given-names>Yulia Alexandrovna</given-names></name></name-alternatives><email>yashichkina@etu.ru</email></contrib></contrib-group><pub-date pub-type="epub"><year>2026</year></pub-date><volume>11</volume><issue>3</issue><fpage>0</fpage><lpage>0</lpage><self-uri content-type="pdf" xlink:href="/media/information/2026/3/ИТ_НР_11_3_6.pdf" /><abstract xml:lang="ru"><p>Надежность моделей машинного обучения в таких ответственных приложениях, как диагностика опухолей головного мозга, критически зависит от качества обучающих данных. В данной статье представлен анализ четырех широко используемых наборов данных МРТ головного мозга: Chakrabarty, Br35H, Bhuvaji и Figshare. Мы оцениваем эти наборы данных по ключевым критериям достоверности, включая происхождение данных, целостность меток, независимость выборки, репрезентативность и соблюдение этических норм. Наши результаты показывают, что только набор данных Figshare удовлетворяет большинству основных стандартов качества. Остальные три демонстрируют серьезные недостатки, такие как неправильная маркировка, скрытое дублирование и этические нарушения, которые ставят под угрозу их научную достоверность. Контролируемые эксперименты дополнительно демонстрируют, что эти проблемы качества данных могут искусственно завышать производительность модели на значительные величины, подрывая надежность эталонных данных. Мы приходим к выводу, что такие наборы данных, как Chakrabarty, Br35H и Bhuvaji, требуют существенной структурной доработки, прежде чем их можно будет ответственно использовать в клинической разработке ИИ.</p></abstract><trans-abstract xml:lang="en"><p>The reliability of machine learning models in high-stakes applications like brain tumor diagnosis depends critically on the quality of training data. This paper presents a forensic audit of four widely used brain MRI datasets: Chakrabarty, Br35H, Bhuvaji, and Figshare. We evaluate these datasets against key validity criteria, including data provenance, label integrity, sample independence, representativeness, and ethical compliance. Our findings reveal that only the Figshare dataset satisfies most essential quality standards. The remaining three exhibit profound flaws &amp;ndash; such as label inaccuracies, undisclosed duplication, and ethical lapses &amp;ndash; that compromise their scientific validity. Controlled experiments further demonstrate that these data-quality issues can artificially inflate model performance by significant margins, undermining benchmark reliability. We conclude that datasets like Chakrabarty, Br35H, and Bhuvaji require substantial structural revision before they can be responsibly used in clinical AI development.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>качество данных</kwd><kwd>ограниченные данные</kwd><kwd>аномалии МРТ</kwd><kwd>надежность модели</kwd><kwd>этичный ИИ</kwd></kwd-group><kwd-group xml:lang="en"><kwd>data quality</kwd><kwd>constrained data</kwd><kwd>MRI abnormalities</kwd><kwd>model reliability</kwd><kwd>ethical AI</kwd></kwd-group></article-meta></front><back /></article>