АНАЛИЗ ДАННЫХ В Хайдар Х.А.
PYTHON Лекция 2
ЦЕЛИ ОБУЧЕНИЯ
1. Описать методы форматирования данных.
2. продемонстрировать использование биннинга (Binning) .
3. Продемонстрировать использование категорических переменных.
4. Определить методов предварительной обработки данных.
5. Описывать нормализации данных.
ОБРАБОТКА ДАННЫХ(DATA
WRANGLING)
ПРЕДВАРИТЕЛЬНАЯ
ОБРАБОТКА ДАННЫХ В
PYTHON
Это процесс преобразования или сопоставления данных из одной
исходной формы в другой формат, чтобы сделать его готовым для
дальнейшего анализа.
Называется еще
Очистка данных или Обработка данных (data wrangling)
ЦЕЛИ ОБУЧЕНИЯ
1. Определить и обработать пропущенные значения.
2. Форматирование данных.
3. Нормализация данных (Центрирование/Масштабирование).
4. Биннинг данных (Data binning )
5. Преобразование категориальных значений в числовые
переменные.
ПРОСТЫЕ ОПЕРАЦИИ С ФРЕЙМАМИ
ДАННЫХ
РАБОТА С
ПРОПУЩЕННЫМИ
ЗНАЧЕНИЯМИ В PYTHON
ПРОБЛЕМА ОТСУТСТВУЮЩИХ ЗНАЧЕНИЙ
• Что такое пропущенное значение?
• Встречаются пропущенные значения Когда значение данных для объекта для
определенного наблюдения не сохраняется.
• Может быть представлен как “?”, “NaN”, 0, или просто пустая ячейка.
КАК СПРАВИТЬСЯ С НЕДОСТАЮЩИМИ
ДАННЫМИ?
1. Проверьте с источником сбора данных.
2. Отбросьте недостающие значения :
Удалить одну запись данных.
Удалить всю переменную.
3. Замените отсутствующие значения :
заменить его средним значением.
Заменить его модой образца.
заменить его на основе других функций.
4. Оставить отсутствующие данные как отсутствующие данные.
КАК УДАЛИТЬ ПРОПУЩЕННЫЕ
ЗНАЧЕНИЯ В PYTHON?
НЕ ЗАБЫВАЙТЕ
ЗАМЕНИТЬ ОТСУТСТВУЮЩИЕ
ЗНАЧЕНИЯ
ФОРМАТИРОВАНИЕ
ДАННЫХ В PYTHON
ФОРМАТИРОВАНИЕ ДАННЫХ
•Данные обычно собираются из разных мест разными людьми,
которые могут храниться в разных форматах.
• приведение данных в общий стандарт выражения , который
позволяет пользователям делать значимые сравнения.
ПРИМЕНЕНИЕ РАСЧЕТА КО ВСЕМУ
СТОЛБЦУ.
НЕПРАВИЛЬНЫЕ ТИПЫ ДАННЫХ
неправильные типы данных, назначенные функции
ТИПЫ ДАННЫХ В ПАНДАХ И ИСПРАВЛЕНИЕ
ТИПОВ ДАННЫХ
НОРМАЛИЗАЦИЯ
ДАННЫХ
НОРМАЛИЗАЦИЯ ДАННЫХ
НОРМАЛИЗАЦИЯ ДАННЫХ
ненормализованный
•возраст и доход находятся в разных пределах
•трудно сравнивать
•доход больше повлияет на результат
Нормализованный
•аналогичный диапазон значений
•аналогичное влияние на модели
ИМПОРТ CSV В PYTHON
МЕТОДЫ НОРМАЛИЗАЦИИ ДАННЫХ
1. простым масштабированием объектов
2. min-max
3. Z-score
ПРОСТЫМ МАСШТАБИРОВАНИЕМ
ОБЪЕКТОВ
MIN-MAX
Z-SCORE
БИННИНГ (BINNING)
BINNING
•группируете значения вместе в ячейки.
•преобразовать числовые в категориальные переменные.
•сгруппировать набор числовых значений в набор ячеек.
•«цена» здесь представляет собой диапазон атрибутов от 5 000 до 45 500.
BINNING PANDAS
ВИЗУАЛИЗАЦИЯ ДАННЫХ
ПРЕВРАЩЕНИЕ КАТЕГОРИАЛЬНЫХ
ПЕРЕМЕННЫХ В КОЛИЧЕСТВЕННЫЕ
ПЕРЕМЕННЫЕ
КАТЕГОРИАЛЬНЫЙ В
ЧИСЛОВОЙ
•Большинство статистических моделей не могут принимать объекты или
строки в качестве входных данных
•Решение
o добавить фиктивные переменные для каждой уникальной категории
o присвоить 0 или 1 в каждой категории
ФИКТИВНЫЕ ПЕРЕМЕННЫЕ
В PANDAS
РЕЗЮМЕ УРОКА
На этом уроке вы узнали, как:
Выявление и обработка отсутствующих значений: отбрасывайте строки с
неполной информацией и заполняйте отсутствующие данные, используя
средние значения.
Понимание форматирования данных. Упорядочивайте объекты в наборе
данных и делайте их значимыми для анализа данных.
Примените нормализацию к набору данных: понимая актуальность
использования масштабирования функций для ваших данных и то, как
нормализация и стандартизация по-разному влияют на ваш анализ данных.