Основные понятия машинного обучения
Терминология, сложившаяся в машинном обучении стихийно, затрудняет понимание: одни и те же понятия называются по-разному, а за привычными словами наподобие «модель» или «обучение», заимствованными из обихода, стоит не совсем то, что принято в физике.
Для физика рассматриваемый материал знаком под другими названиями. Задача обучения модели сводится к задаче оптимизации, функция потерь представляет собой минимизируемый функционал, а регуляризация является способом сделать некорректную задачу корректной.
Основные термины
- Искусственным интеллектом (AI) называют систему, способную принимать решения на основе восприятия окружающего мира.
- Машинное обучение (ML) составляет подраздел AI и обозначает систему, принимающую решения на основе накопленного опыта (данных) и текущего состояния мира.
- Глубокое обучение (DL) составляет подраздел ML, основанный на использовании глубоких нейронных сетей (Neural Networks, NN).
- Data Science — дисциплина, объединяющая сбор, обработку, анализ и извлечение знаний из данных.
- Big Data обозначает обработку и анализ данных, масштаб которых не позволяет работать с ними в стандартных инструментах (например, в Excel).
Термины, связанные с данными
- Датасетом, или выборкой (Dataset), называют набор данных, поданный алгоритму на вход.
- Признак, или фича (Feature, X), обозначает характеристику или измеряемый параметр объекта.
- Целевая переменная, она же метка или класс (Label, Target, y), задаёт значение, которое требуется предсказать по признакам объекта.
- Законом природы (в контексте ML) называют скрытую взаимосвязь между признаками и целевой переменной, восстанавливаемую моделью. Формально это отображение из пространства признаков
Xв пространство метокy.
Типы задач машинного обучения
Задачи ML делятся по тому, имеется ли у объектов разметка (метка y), проставленная человеком, и какова она.
1. Обучение с учителем (Supervised Learning)
Имеется размеченная обучающая выборка, где каждому объекту сопоставлена правильная метка y. Целью является восстановление закона природы X -> y.
Пример. Отбор событий на детекторе (сигнал / фон), где физик вручную разметил часть накопленных данных.
2. Обучение без учителя (Unsupervised Learning)
Разметка y отсутствует или не используется. Алгоритм ищет структуры, закономерности и связи в самих данных.
Пример. Разбиение зарегистрированных событий на группы по форме сигнала, когда заранее неизвестно, сколько различных процессов в них присутствует.
Основные типы задач
Внутри этих двух парадигм выделяют несколько типовых постановок.
Классификация (Classification)
- Цель: отнести объект к одному из заранее заданных классов.
- Особенность: множество меток
yконечно и часто невелико. - Подвиды: бинарная (2 класса) и многоклассовая (>2 классов).
- Пример: определение болезни по симптомам (болен/здоров), распознавание цифр, написанных от руки.
Регрессия (Regression)
- Цель: предсказать непрерывную числовую величину.
- Особенность: Метка
yпринимает вещественные значения. - Пример: восстановление энергии частицы по зарегистрированному отклику калориметра, прогноз температуры на завтра.
Кластеризация (Clustering)
- Цель: разбить данные на группы (кластеры) так, чтобы объекты внутри одной группы были похожи, а объекты из разных групп отличались.
- Особенность: заранее проставленные метки отсутствуют (обучение без учителя).
- Пример: поиск групп однотипных событий в данных, накопленных установкой, группировка спектров по форме линий.
Снижение размерности (Dimensionality Reduction)
- Цель: уменьшить количество признаков, перейдя в пространство меньшей размерности и сохранив при этом важные структуры данных (близкие объекты должны остаться близкими).
- Применение: визуализация данных (например, 3D -> 2D), борьба с «проклятием размерности», сжатие данных.
Ранжирование (Ranking)
- Цель: упорядочить объекты (например, документы или товары) по их релевантности запросу или предпочтениям пользователя.
- Пример: выдача результатов поиска, рекомендательные системы.
Генерация (Generation)
- Цель: создавать новые объекты (изображения, текст, музыку), похожие на объекты обучающей выборки, но не совпадающие ни с одним из них.
- Пример: генерация реалистичных лиц, написание текстов в стиле определённого автора.
Типы признаков (Features)
От типа признака зависит как выбор модели, так и способ предобработки, применяемой к данным.
- Бинарные: выбор из двух вариантов (да/нет, кот/не кот).
- Номинальные (категориальные): конечное множество без порядка (цвета, марки машин).
- Порядковые (ординальные): конечное упорядоченное множество (оценки: плохо/удовлетворительно/хорошо/отлично).
- Числовые (вещественные): непрерывные величины (рост, цена, расстояние).
Типы признаков допускают преобразование: если числовой признак разбить на интервалы с заранее выбранными границами, получится порядковый.
Устройство модели
Моделью машинного обучения называют параметрическую функцию (или «чёрный ящик»), отображающую пространство признаков X в пространство ответов y, то есть Model: X -> y.
Внутренние настройки модели называют параметрами, а их подбор по данным — обучением. Параметры изменяются так, чтобы предсказания на обучающей выборке как можно ближе сходились с заранее проставленными метками (или, если метки отсутствуют, чтобы модель выявила скрытую структуру).
На качество обученной модели влияют качество собранных данных, выбор алгоритма, его гиперпараметры и аккуратность процедуры обучения.
В следующей главе осуществляется переход от общих понятий к конкретным алгоритмам, начиная с самого наглядного, метода ближайших соседей.