Kitobdan iqtiboslar Теоретический минимум по Big Data. Всё что нужно знать о больших данныхmualliflar Анналин Ын, Кеннет Су
Более того, исключение элементов данных может привести к искаженным результатам в отношении отдельных групп. Например, коты могут менее охотно, чем другие, раскрывать информацию о количестве приобретаемых фруктов. Если мы удалим такие покупки, коты будут недостаточно представлены в итоговой выборке.
2 kishiga yoqdi
Если пропущено значение бинарного или категориального типа, его можно заменить самым типичным значением (модой) переменной
1 kishiga yoqdi
Кросс-валидация (cross-validation) позволяет полностью задействовать данные путем разделения их набора на несколько сегментов для поочередной проверки модели. За одну итерацию все сегменты, кроме одного, используются для обучения модели, которая сама проверяется на последнем сегменте. Этот процесс повторяется до тех пор, пока каждый сегмент не отработает в роли тестового (рис. 3).
Валидация (validation) — это оценка того, насколько хорошо модель предсказывает новые данные. Тем не менее вместо ожидания новых данных для проверки модели мы можем разбить наш текущий набор данных на два сегмента. Первый выступит в роли нашего обучающего набора данных (training dataset), а второй послужит заменой для новой информации в качестве тестового набора данных (test dataset) для оценки точности прогностической модели. Лучшей моделью признается та, которая дает самые точные предсказания на тестовом наборе. Чтобы процесс валидации был эффективен, мы должны выбирать элементы для обучающего и тестового набора данных случайно и беспристрастно.
Метрики классификации
Процент верных прогнозов. Простейшая мера точности прогнозирования — это доля достоверно правильных предсказаний. Вернемся к примеру с гастрономическими покупками из табл. 1. Мы можем выразить результаты задачи по предсказанию покупки рыбы в таком утверждении: Наша модель с точностью 90 % предсказывает, будет ли покупатель брать рыбу. Хотя эта метрика не так сложна для понимания, она не дает представления о том, где именно происходят ошибки прогнозирования.
Таблица 4. Матрица неточностей показывает точность предсказаний о покупке рыбы
Матрица неточностей. Матрица неточностей (confusion matrix) дает представление о том, где наша модель прогнозирования преуспела и где она потерпела неудачу.
Посмотрите на табл. 4. Хотя общая точность модели составляет 90 %, она гораздо лучше предсказывает не покупки, чем покупки. Мы также видим, что число прогностических ошибок равномерно (по 5) распределилось между ложноположительными (FP, false positives) и ложноотрицательными (FN, false negatives).
Разновидности прогностических ошибок могут иметь решающее значение. Ложноотрицательный результат в предсказании землетрясения (то есть землетрясения не ожидалось, но оно произошло) обойдется куда дороже, чем ложноположительный (землетрясение ожидалось, но не случилось).
Метрика регрессии
Корень из среднеквадратичной ошибки (Root Mean Squared Error, RMSE). Поскольку при регрессии используются непрерывные числовые значения, то ошибки обычно измеряют количественно, как разницу между предсказанными и реальными значениями, распределяя штрафы и исходя из величины ошибки. Корень из среднеквадратичной ошибки — это популярная метрика регрессии, особенно полезная в случаях, когда мы хотим избежать крупных ошибок: каждая из них возводится в квадрат, что усиливает значимость такой ошибки. Это делает метрику крайне чувствительной к резко отклоняющимся значениям, за которые она штрафует модель.
Одним из способов держать под контролем сложность модели является введение штрафного параметра в процессе регуляризации. Этот новый параметр штрафует модель за сложность, искусственно увеличивая погрешность и этим побуждая алгоритм находить оптимальное соотношение точности со сложностью. Тем самым сохраняя простоту модели, мы можем обеспечить ее масштабируемость.
В отличие от обучения с учителем и без, где модели проходят обучение и после применяются без дальнейших изменений, модель обучения с подкреплением постоянно развивается, используя результаты обратной связи.
Когда мы предсказываем целые или непрерывные числа, такие как количество фруктов, мы решаем проблему регрессии (рис. 1, а). А когда мы предсказываем бинарное или категориальное значение, например, пойдет ли дождь, мы занимаемся проблемой классификации (рис. 1, b). Тем не менее многие алгоритмы классификации способны также выдавать прогноз в виде непрерывного значения, как в высокоточных утверждениях типа «вероятность дождя 75 %».
Более того, исключение элементов данных может привести к искаженным результатам в отношении отдельных групп. Например, коты могут менее охотно, чем другие, раскрывать информацию о количестве приобретаемых фруктов. Если мы удалим такие покупки, коты будут недостаточно представлены в итоговой выборке.
Типы переменных
Есть четыре главных типа переменных. Чтобы убедиться, что к ним применимы выбранные алгоритмы, важно понимать разницу.
• Бинарная. Это простейший тип переменных только с двумя вариантами значения. В табл. 1 бинарная переменная показывает, брал ли покупатель рыбу.
• Категориальная. Если вариантов больше двух, информация может быть представлена категориальной переменной. В табл. 1 категориальная переменная описывает вид покупателя.
• Целочисленная. Такой тип используется, когда информация может быть представлена целым числом. В табл. 1 целое число выражает количество купленных каждым покупателем фруктов.
• Непрерывная (количественная). Это самая подробная переменная. Она содержит числа со знаками после запятой. В табл. 1 такие переменные показывают количество потраченных покупателем денег.
