Несколько ИИ-моделей прогнозирования заболеваний оказались обучены на сомнительных данных
Исследование показало: два открытых набора данных, использованных для обучения моделей ИИ прогнозирования заболеваний, содержат множество аномальных данных, предположительно сфабрикованных. Некоторые из этих моделей уже внедрены в клиническую практику.
Short Summary
Исследование, опубликованное на сервере препринтов medRxiv, указывает на то, что два набора открытых медицинских данных, используемых для обучения модели искусственного интеллекта для прогнозирования заболеваний, могут содержать сфабрикованные данные. Команда Адриана Барнетта (Adrian Barnett) из Технологического университета Квинсленда (Австралия) обнаружила, что 124 рецензируемых статьи использовали эти наборы данных, но не указали источник данных, и в данных присутствуют многочисленные аномалии, которые не могут быть получены от реальных людей.
Эти наборы данных взяты с платформы Kaggle. Один из них — набор данных для прогнозирования инсульта — содержит информацию о здоровье 5110 человек, а другой — набор данных для прогнозирования сахарного диабета — содержит информацию о 100 тысячах человек. Исследователи обнаружили, что в наборе данных об инсульте очень мало пропущенных значений уровня глюкозы в крови, что не соответствует характеристикам реальных данных; в наборе данных о сахарном диабете у всех участников было всего 18 дискретных значений уровня глюкозы, и присутствовали тысячи повторяющихся значений. Исследователи считают, что эти аномалии указывают на то, что данные могут быть сфабрикованы, а прогностические модели, основанные на таких данных, могут привести к ошибочным клиническим решениям, например, к назначению ненужного лечения или пропуску необходимого лечения.
На данный момент по крайней мере две модели, обученные на этих подозрительных данных, уже используются в больницах Индонезии и Испании, и одна из них была использована в заявке на патент медицинского устройства. Кроме того, две модели доступны в качестве онлайн-инструментов для общественности. Исследователи и эксперты призывают исследовательские учреждения и финансирующие организации требовать раскрытия источника данных, журналы должны отклонять статьи, в которых не указан источник данных, и предлагается немедленно удалить эти подозрительные наборы данных, чтобы предотвратить их дальнейшее влияние на последующие исследования и клиническое применение.
Аномалии в полноте данных
В наборе данных для прогнозирования инсульта очень мало пропущенных данных, что не соответствует характеристикам реальных данных, что указывает на возможную недостоверность сбора данных
Аномалии в дискретности данных
В наборе данных для прогнозирования сахарного диабета у 100 тысяч участников было обнаружено всего 18 дискретных значений уровня глюкозы, что не соответствует разнообразию популяции
Модели уже применяются в клинике
По крайней мере две модели ИИ, основанные на подозрительных данных, уже используются в больницах Индонезии и Испании, и одна из них была использована в заявке на патент медицинского устройства
Широкое влияние исследования
В общей сложности 124 рецензируемые статьи использовали эти наборы данных для обучения моделей машинного обучения, и данные были скачаны более 280 тысяч раз
Text generated using AI

