<?xml version='1.0' encoding='utf-8'?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.2 20190208//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
<article article-type="research-article" dtd-version="1.2" xml:lang="ru" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink"><front><journal-meta><journal-id journal-id-type="issn">2518-1092</journal-id><journal-title-group><journal-title>Research result. Information technologies</journal-title></journal-title-group><issn pub-type="epub">2518-1092</issn></journal-meta><article-meta><article-id pub-id-type="doi">10.18413/2518-1092-2026-11-3-0-6</article-id><article-id pub-id-type="publisher-id">4359</article-id><article-categories><subj-group subj-group-type="heading"><subject>ARTIFICIAL INTELLIGENCE AND DECISION MAKING</subject></subj-group></article-categories><title-group><article-title>&lt;strong&gt;VALIDITY ASSESSMENT OF PUBLIC MRI DATASETS FOR NEURO-ONCOLOGICAL ABNORMALITY DETECTION: UNCOVERING CRITICAL DATA QUALITY ISSUES&lt;/strong&gt;</article-title><trans-title-group xml:lang="en"><trans-title>&lt;strong&gt;VALIDITY ASSESSMENT OF PUBLIC MRI DATASETS FOR NEURO-ONCOLOGICAL ABNORMALITY DETECTION: UNCOVERING CRITICAL DATA QUALITY ISSUES&lt;/strong&gt;</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Nizamli</surname><given-names>Yasser</given-names></name><name xml:lang="en"><surname>Nizamli</surname><given-names>Yasser</given-names></name></name-alternatives><email>yanizamli@stud.etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Filatov</surname><given-names>Anton Yuryevich</given-names></name><name xml:lang="en"><surname>Filatov</surname><given-names>Anton Yuryevich</given-names></name></name-alternatives><email>aifilatov@etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Fadel</surname><given-names>Weaam</given-names></name><name xml:lang="en"><surname>Fadel</surname><given-names>Weaam</given-names></name></name-alternatives><email>vfadel@stud.etu.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Shichkina</surname><given-names>Yulia Alexandrovna</given-names></name><name xml:lang="en"><surname>Shichkina</surname><given-names>Yulia Alexandrovna</given-names></name></name-alternatives><email>yashichkina@etu.ru</email></contrib></contrib-group><pub-date pub-type="epub"><year>2026</year></pub-date><volume>11</volume><issue>3</issue><fpage>0</fpage><lpage>0</lpage><self-uri content-type="pdf" xlink:href="/media/information/2026/3/ИТ_НР_11_3_6.pdf" /><abstract xml:lang="ru"><p>The reliability of machine learning models in high-stakes applications like brain tumor diagnosis depends critically on the quality of training data. This paper presents a forensic audit of four widely used brain MRI datasets: Chakrabarty, Br35H, Bhuvaji, and Figshare. We evaluate these datasets against key validity criteria, including data provenance, label integrity, sample independence, representativeness, and ethical compliance. Our findings reveal that only the Figshare dataset satisfies most essential quality standards. The remaining three exhibit profound flaws &amp;ndash; such as label inaccuracies, undisclosed duplication, and ethical lapses &amp;ndash; that compromise their scientific validity. Controlled experiments further demonstrate that these data-quality issues can artificially inflate model performance by significant margins, undermining benchmark reliability. We conclude that datasets like Chakrabarty, Br35H, and Bhuvaji require substantial structural revision before they can be responsibly used in clinical AI development.</p></abstract><trans-abstract xml:lang="en"><p>The reliability of machine learning models in high-stakes applications like brain tumor diagnosis depends critically on the quality of training data. This paper presents a forensic audit of four widely used brain MRI datasets: Chakrabarty, Br35H, Bhuvaji, and Figshare. We evaluate these datasets against key validity criteria, including data provenance, label integrity, sample independence, representativeness, and ethical compliance. Our findings reveal that only the Figshare dataset satisfies most essential quality standards. The remaining three exhibit profound flaws &amp;ndash; such as label inaccuracies, undisclosed duplication, and ethical lapses &amp;ndash; that compromise their scientific validity. Controlled experiments further demonstrate that these data-quality issues can artificially inflate model performance by significant margins, undermining benchmark reliability. We conclude that datasets like Chakrabarty, Br35H, and Bhuvaji require substantial structural revision before they can be responsibly used in clinical AI development.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>data quality</kwd><kwd>constrained data</kwd><kwd>MRI abnormalities</kwd><kwd>model reliability</kwd><kwd>ethical AI</kwd></kwd-group><kwd-group xml:lang="en"><kwd>data quality</kwd><kwd>constrained data</kwd><kwd>MRI abnormalities</kwd><kwd>model reliability</kwd><kwd>ethical AI</kwd></kwd-group></article-meta></front><back /></article>