АНАЛИЗ ДАННЫХ В Хайдар Х.А.
PYTHON Лекция 3
ЦЕЛИ ОБУЧЕНИЯ
1. Применять методы исследовательского анализа данных Python
2. Реализовать описательную статистику
3. Демонстрация основ группировки.
4. Описывать почему и как применять критерий хи-квадрат
5. Описывать процессы корреляции данных
ИССЛЕДОВАТЕЛЬСКИЙ АНАЛИЗ ДАННЫХ
ДЕСКРИПТИВНАЯ
СТАТИСТИКА
описать основные свойства данных
предоставление кратких сводок о выборке и измерениях данных
ДЕСКРИПТИВНАЯ
СТАТИСТИКА-DESCRIBE()
суммировать, используя метод pandas describe()
ДЕСКРИПТИВНАЯ СТАТИСТИКА-
VALUE_COUNTS()
суммировать категориальные данные с помощью метода
value_counts()
ДЕСКРИПТИВНАЯ СТАТИСТИКА- БОКС-
ПЛОТС BOXPLOTS
БОКС-ПЛОТС ПРИМЕР BOXPLOTS
ДИАГРАММА РАССЕЯНИЯ -ТОЧЕЧНАЯ
ДИАГРАММА (SCATTERPLOTS)
каждое наблюдение представлено в виде точки
Диаграмма рассеяния показывает взаимосвязь между двумя
переменными
1. предсказатель /независимые переменные на
горизонтальной оси
2. целевые/зависимые переменные по вертикальной оси
ДИАГРАММА РАССЕЯНИЯ -ТОЧЕЧНАЯ
ДИАГРАММА (SCATTERPLOTS)
GROUPBY PYTHON
ГРУППИРОВКА ДАННЫХ
группировка данных
Использовать метод Pandas [Link]():
1. может применяться к категориальным переменным.
2. группировать данные по категориям.
3. одна или несколько переменных
ГРУППИРОВКА ДАННЫХ
МЕТОД PANDAS – PIVOT()
одна переменная отображается вдоль столбцов, а другая
переменная отображается вдоль строк
ТЕПЛОВАЯ КАРТА-
HEATMAP
построить целевую переменную по нескольким переменным
КОРРЕЛЯЦИЯ
КОРРЕЛЯЦИЯ
что такое корреляция?
Измеряет, в какой степени различные переменные
взаимозависимы.
Например :
Рак легких => курение
Дождь => Зонт
Корреляция не подразумевает причинно-следственную связь
КОРРЕЛЯЦИЯ - ПОЛОЖИТЕЛЬНАЯ ЛИНЕЙНАЯ
ЗАВИСИМОСТЬ
корреляция между двумя характеристиками (объем
двигателя и цена)
КОРРЕЛЯЦИЯ - ОТРИЦАТЕЛЬНАЯ ЛИНЕЙНАЯ
ЗАВИСИМОСТЬ
корреляция между двумя характеристиками (Расход топливо
и цена)
КОРРЕЛЯЦИЯ - ОТРИЦАТЕЛЬНАЯ ЛИНЕЙНАЯ
ЗАВИСИМОСТЬ
слабая корреляция между двумя функциями (пиковые
обороты и цена)
КОРРЕЛЯЦИИ ПИРСОНА
измерить силу корреляции между двумя признаками.
1. коэффициент корреляции
2. p-значение
коэффициент корреляции :
1. близко к + 1: большие положительные отношения.
2. близко к -1: большая отрицательная связь
3. близко к нулю: нет связи
P-VALUE ( P-ЗНАЧЕНИЕ)
p-значение
1. p-значение < 0,001 сильная уверенность в результате.
2. р-значение < 0,05 Умеренная уверенность в результате.
3. р-значение < 0,1 слабая уверенность в результате.
4. р-значение > 0,1 нет уверенности в результате.
сильная корреляция:
1. коэффициент корреляции близок к -1, +1
2. P-значение менее 0,001
КОРРЕЛЯЦИИ ПИРСОНА
КОРРЕЛЯЦИИ ПИРСОНА
КОРРЕЛЯЦИОННАЯ - ТЕПЛОВАЯ
КАРТА
ХИ-КВАДРАТ
КАТЕГОРИАЛЬНЫЕ
ПЕРЕМЕННЫЕ
мы используем критерий хи-квадрат для ассоциации
Тест предназначен для проверки вероятности того, что
наблюдаемое распределение обусловлено случайностью.
Хи-квадрат проверяет нулевую гипотезу о том, что
переменные независимы.
Хи-квадрат не говорит вам о типе связи, которая существует
между обеими переменными, а только о том, что связь
существует.
КАТЕГОРИАЛЬНЫЕ
ПЕРЕМЕННЫЕ
КАТЕГОРИАЛЬНЫЕ
ПЕРЕМЕННЫЕ
КАТЕГОРИАЛЬНЫЕ
ПЕРЕМЕННЫЕ
КАТЕГОРИАЛЬНЫЕ
ПЕРЕМЕННЫЕ
РЕЗЮМЕ УРОКА
На этом уроке вы узнали, как:
1. Описать исследовательский анализ данных: суммируя основные характеристики данных и извлекая
ценную информацию.
2. Вычислить базовую описательную статистику: рассчитайте среднее значение, медиану и моду с
помощью Python и используйте их в качестве основы для понимания распределения данных.
3. Создание групп данных: как и почему вы объединяете непрерывные данные в группы и как их
визуализировать.
4. Определить корреляцию как линейную связь между двумя числовыми переменными: используйте
корреляцию Пирсона как меру корреляции между двумя непрерывными переменными.
5. Определить связь между двумя категориальными переменными: поймите, как найти связь между
двумя переменными, используя критерий хи-квадрат для связи, и как их интерпретировать.