Основные понятия машинного обучения

Терминология, сложившаяся в машинном обучении стихийно, затрудняет понимание: одни и те же понятия называются по-разному, а за привычными словами наподобие «модель» или «обучение», заимствованными из обихода, стоит не совсем то, что принято в физике.

Для физика рассматриваемый материал знаком под другими названиями. Задача обучения модели сводится к задаче оптимизации, функция потерь представляет собой минимизируемый функционал, а регуляризация является способом сделать некорректную задачу корректной.

Основные термины

  • Искусственным интеллектом (AI) называют систему, способную принимать решения на основе восприятия окружающего мира.
  • Машинное обучение (ML) составляет подраздел AI и обозначает систему, принимающую решения на основе накопленного опыта (данных) и текущего состояния мира.
  • Глубокое обучение (DL) составляет подраздел ML, основанный на использовании глубоких нейронных сетей (Neural Networks, NN).
  • Data Science — дисциплина, объединяющая сбор, обработку, анализ и извлечение знаний из данных.
  • Big Data обозначает обработку и анализ данных, масштаб которых не позволяет работать с ними в стандартных инструментах (например, в Excel).

Термины, связанные с данными

  • Датасетом, или выборкой (Dataset), называют набор данных, поданный алгоритму на вход.
  • Признак, или фича (Feature, X), обозначает характеристику или измеряемый параметр объекта.
  • Целевая переменная, она же метка или класс (Label, Target, y), задаёт значение, которое требуется предсказать по признакам объекта.
  • Законом природы (в контексте ML) называют скрытую взаимосвязь между признаками и целевой переменной, восстанавливаемую моделью. Формально это отображение из пространства признаков X в пространство меток y.

Типы задач машинного обучения

Задачи ML делятся по тому, имеется ли у объектов разметка (метка y), проставленная человеком, и какова она.

1. Обучение с учителем (Supervised Learning)

Имеется размеченная обучающая выборка, где каждому объекту сопоставлена правильная метка y. Целью является восстановление закона природы X -> y.

Пример. Отбор событий на детекторе (сигнал / фон), где физик вручную разметил часть накопленных данных.

2. Обучение без учителя (Unsupervised Learning)

Разметка y отсутствует или не используется. Алгоритм ищет структуры, закономерности и связи в самих данных.

Пример. Разбиение зарегистрированных событий на группы по форме сигнала, когда заранее неизвестно, сколько различных процессов в них присутствует.

Основные типы задач

Внутри этих двух парадигм выделяют несколько типовых постановок.

Классификация (Classification)

  • Цель: отнести объект к одному из заранее заданных классов.
  • Особенность: множество меток y конечно и часто невелико.
  • Подвиды: бинарная (2 класса) и многоклассовая (>2 классов).
  • Пример: определение болезни по симптомам (болен/здоров), распознавание цифр, написанных от руки.

Регрессия (Regression)

  • Цель: предсказать непрерывную числовую величину.
  • Особенность: Метка y принимает вещественные значения.
  • Пример: восстановление энергии частицы по зарегистрированному отклику калориметра, прогноз температуры на завтра.

Кластеризация (Clustering)

  • Цель: разбить данные на группы (кластеры) так, чтобы объекты внутри одной группы были похожи, а объекты из разных групп отличались.
  • Особенность: заранее проставленные метки отсутствуют (обучение без учителя).
  • Пример: поиск групп однотипных событий в данных, накопленных установкой, группировка спектров по форме линий.

Снижение размерности (Dimensionality Reduction)

  • Цель: уменьшить количество признаков, перейдя в пространство меньшей размерности и сохранив при этом важные структуры данных (близкие объекты должны остаться близкими).
  • Применение: визуализация данных (например, 3D -> 2D), борьба с «проклятием размерности», сжатие данных.

Ранжирование (Ranking)

  • Цель: упорядочить объекты (например, документы или товары) по их релевантности запросу или предпочтениям пользователя.
  • Пример: выдача результатов поиска, рекомендательные системы.

Генерация (Generation)

  • Цель: создавать новые объекты (изображения, текст, музыку), похожие на объекты обучающей выборки, но не совпадающие ни с одним из них.
  • Пример: генерация реалистичных лиц, написание текстов в стиле определённого автора.

Типы признаков (Features)

От типа признака зависит как выбор модели, так и способ предобработки, применяемой к данным.

  • Бинарные: выбор из двух вариантов (да/нет, кот/не кот).
  • Номинальные (категориальные): конечное множество без порядка (цвета, марки машин).
  • Порядковые (ординальные): конечное упорядоченное множество (оценки: плохо/удовлетворительно/хорошо/отлично).
  • Числовые (вещественные): непрерывные величины (рост, цена, расстояние).

Типы признаков допускают преобразование: если числовой признак разбить на интервалы с заранее выбранными границами, получится порядковый.

Устройство модели

Моделью машинного обучения называют параметрическую функцию (или «чёрный ящик»), отображающую пространство признаков X в пространство ответов y, то есть Model: X -> y.

Внутренние настройки модели называют параметрами, а их подбор по данным — обучением. Параметры изменяются так, чтобы предсказания на обучающей выборке как можно ближе сходились с заранее проставленными метками (или, если метки отсутствуют, чтобы модель выявила скрытую структуру).

На качество обученной модели влияют качество собранных данных, выбор алгоритма, его гиперпараметры и аккуратность процедуры обучения.


В следующей главе осуществляется переход от общих понятий к конкретным алгоритмам, начиная с самого наглядного, метода ближайших соседей.