Abstract:
В статье рассматриваются аспекты исследования данных, глубокого анализа данных, получения знаний, способов обработки данных в базе знаний, методов интеллектуального анализа и применения технологии Data Mining в области медицины. Выявлена группа ВИЧ-инфицированных больных, проведен анализ с историей заболеваний, разработаны модели и разработан алгоритм действий (входные данные), проведен анализ и эксперименты с методами поиска данных. Все болезни были представлены в виде набора числовых векторов и были сгруппированы в кластеры, согласно описанной методологии, с помощью этого распределения было рассчитано значение статистики Хопкинса. Сама кластеризация осуществлялась с использованием обычных инструментов библиотеки sklearn. Предложены различные методы представления многомерных данных в двумерной плоскости метод основных компонентов, линия Кохонена и др.