Now Reading
Разбираемся в том, как устроен ИИ вместе с Chat GPT

Разбираемся в том, как устроен ИИ вместе с Chat GPT

%D1%81%D1%82%D0%B0%D1%82%D1%8C%D1%8F %D0%BE%D0%B1 %D0%B8%D0%B8

Журнал The Status Symbol разбирается, как устроен искусственный интеллект с помощью вопросов, как на собеседовании в Open AI.

Машинное обучение разделяют на несколько уровней. Сначала мы представляем реальные данные в числовом пространстве — через признаки, векторы или эмбеддинги (способ представления сложных объектов в виде числовых векторов). Затем выбираем задачу: классификация, регрессия или обучение без учителя. Модель задаёт способ описания зависимости, а алгоритм обучения подбирает её параметры, минимизируя некоторую функцию потерь. Вероятностный подход позволяет моделировать неопределённость. Линейная алгебра обеспечивает операции с векторами и матрицами, а статистика — основу оценки параметров и вероятностей. При этом выбор метода зависит от данных: например, случайный лес и бустинг часто сильны на табличных данных, эмбеддингах и трансформерах— на современных задачах работы с текстом, а PCA (метод главных компонент, principal component analysis) остаётся полезным классическим методом снижения размерности

Chat GPT

1. Что такое ML-модель?

ML-модель — это модель машинного обучения и математическая функция, которая по данным учится находить закономерности и делать предсказания. Во время обучения модель подбирает параметры так, чтобы минимизировать ошибку на обучающих данных.

Например, в линейной регрессии:

ŷ = w₁x₁ + w₂x₂ + … + b

где x — признаки, w — параметры модели, b — смещение, а ŷ — предсказание.

Важно различать модель и алгоритм обучения: модель задаёт способ представления зависимости, а алгоритм определяет, как подобрать её параметры.

2. Как ML работает с неопределённостью?

Теория вероятности

В реальных данных мы редко знаем результат точно. Поэтому неопределённость формализуют с помощью теории вероятностей.

Например, модель может сказать:

вероятность того, что письмо является спамом — 95%.

То есть модель не просто выдаёт ответ, а может оценивать вероятность различных исходов.

Теорема Байеса

Байесовская логика позволяет обновлять наше представление о вероятности события после получения новых данных:

P(A|B) = P(B|A)P(A) / P(B)

* P(A) — априорная вероятность;

* P(B|A) — вероятность наблюдать данные B, если A истинно;

* P(A|B) — апостериорная вероятность.

Простыми словами: мы начинаем с некоторого предположения и корректируем его после получения новых наблюдений.

Максимальное правдоподобие

Maximum Likelihood Estimation (MLE) — способ подобрать параметры модели так, чтобы наблюдавшиеся данные были наиболее вероятны при этих параметрах.

Например, если мы предполагаем, что данные имеют нормальное распределение, MLE позволяет оценить его параметры по имеющейся выборке.

Априорное, апостериорное и предсказательное распределения

* Prior — что мы предполагали до получения данных.

* Posterior — что мы считаем после учёта данных.

* Predictive distribution — какие результаты модель ожидает для новых данных.

Математическая вероятностная модель фактически задаёт распределение вероятностей возможных данных или исходов.

3. Обучение без учителя и кластеризация

Unsupervised learning — обучение на данных без заранее известных правильных ответов.

Метод k-средних (K-means)

K-means разбивает объекты на K кластеров так, чтобы объекты внутри одного кластера были максимально похожи.

Алгоритм:

1. выбирает центры кластеров;

2. относит точки к ближайшему центру;

3. пересчитывает центры;

4. повторяет процесс.

Минус: нужно заранее выбрать K, а результат зависит от формы и масштаба данных.

Метод гауссовсих смесей (Gaussian Mixture Model)

GMM предполагает, что данные образованы смесью нескольких гауссовских распределений.

В отличие от K-means, объект может принадлежать кластерам с определёнными вероятностями, поэтому GMM даёт более гибкую модель.

Другие методы кластеризации

Да. Например:

* DBSCAN — хорошо находит кластеры произвольной формы и выбросы;

* иерархическая кластеризация;

* spectral clustering;

* HDBSCAN.

Метод к-ближайших соседей (K-nearest neighbors (KNN) не является методом обучения без учителя. Это алгоритм обучения с учителем, применяемый для классификации и регрессии.

4. Сокращение размерности и представление данных

Сокращение размерности — преобразование данных из пространства с большим количеством признаков в пространство меньшей размерности с сохранением наиболее важной информации.

PCA — метод главных компонент

PCA ищет направления, в которых данные имеют максимальную дисперсию.

Он используется для:

* уменьшения количества признаков;

* визуализации;

* удаления коррелированных признаков;

* ускорения обучения.

PCA — классический и очень полезный метод, но он в основном описывает линейные зависимости.

MDS — многомерное шкалирование

MDS пытается представить объекты в пространстве меньшей размерности так, чтобы расстояния между объектами максимально соответствовали исходным расстояниям.

Моделирование многообразий

Предполагается, что сложные данные находятся около некоторого многомерного, но локально более простого пространства — многообразия.

Методы:

* Isomap;

* LLE;

* UMAP;

* t-SNE (Стохастическое вложение соседей с t-распределением)

t-SNE и UMAP сегодня особенно популярны для визуализации, но их не стоит автоматически использовать как универсальную замену PCA для построения признаков: они оптимизируют другие свойства пространства.

5. Текст: как превратить слова в числа?

ML-модель не может непосредственно работать с текстом. Текст необходимо представить в числовом виде.

Bag of Words

Мешок слов представляет текст как набор слов и их частот.

Например:

“cat likes milk”

превращается в числовой вектор, где каждая координата соответствует определённому слову.

Недостаток: практически не учитывается порядок слов и семантический контекст.

TF-IDF

TF-IDF оценивает важность слова:

TF — насколько часто слово встречается в конкретном документе.

IDF — насколько слово редкое среди всех документов.

Таким образом, частые в конкретном тексте, но редкие в корпусе слова получают больший вес.

TF-IDF — классический и до сих пор полезный метод, но для современных NLP-задач часто уступает embeddings и transformer-моделям.

Латентно-семантический анализ

LSA использует матрицу «документы × слова» и SVD, чтобы найти скрытые семантические темы.

Это исторически важный метод снижения размерности текста. Сегодня его во многих задачах заменили более мощные embeddings и transformer-модели.

Эмбеддинги (Embeddings)

Современный подход — переводить слова, предложения, изображения или другие объекты в векторы — эмбеддинги (embeddings).

Идея: семантически похожие объекты должны находиться близко друг к другу в векторном пространстве.

В современных системах, особенно NLP, embeddings являются фундаментальным представлением данных.

6. Обучение с учителем: классификация и регрессия

Классификация

Модель предсказывает категорию.

Например:

spam / not spam.

Регрессия

Модель предсказывает числовое значение.

Например:

стоимость квартиры = $500 000.

Деревья решений

Decision Tree последовательно разделяет данные по признакам.

Например:

площадь > 50 м²? → да → цена выше.

Преимущество — интерпретируемость и способность работать с нелинейными зависимостями.

Недостаток — одиночное дерево легко переобучается.

Случайный лес (Random Forest)

Random Forest объединяет много деревьев решений и усредняет их ответы или использует голосование.

Это пример bagging.

Главная идея: много относительно независимых деревьев обычно дают более устойчивый результат, чем одно дерево.

Бустинг (Boosting)

Boosting строит модели последовательно, где следующие модели пытаются исправить ошибки предыдущих.

Примеры:

* Gradient Boosting;

* XGBoost;

* LightGBM;

* CatBoost.

Boosting очень силён на табличных данных и часто является одним из лучших классических подходов.

7. SVM (метод опорных векторов) и KNN (метод k-ближайших соседей)

Метод опорных векторов (Support Vector Machine)

SVM ищет границу, которая максимально разделяет классы.

Ключевая идея — максимизировать margin, то есть расстояние от границы до ближайших объектов разных классов.

С помощью ядерного трюка (kernel trick) можно работать с нелинейными границами, например используя RBF-ядро.

SVM особенно полезен на небольших и средних датасетах с хорошо подобранными признаками. Для очень больших современных задач глубокие нейросети обычно предпочтительнее.

Метод k-ближайших соседей (KNN)

K-nearest neighbors классифицирует объект по его ближайшим соседям или использует их значения для регрессии.

Плюс — очень простой метод.

Минусы:

* медленное предсказание на больших датасетах;

* чувствительность к масштабу признаков;

* проблемы при большой размерности.

8. Наивный Байес

Наивный Байес использует теорему Байеса и предполагает условную независимость признаков.

Cмысл теоремы Байеса сводится к утверждению, что изначальное (априорное) суждение (событие А), дополненное новой информацией (событие В), даст более приближенную к реальности картину. Другими словами, логика Байеса дает возможность уточнить вероятность того или иного события, учитывая и ранее известные факты, и новые наблюдения.

Например, при определении спама слова рассматриваются как признаки, и модель оценивает:

P(spam | слова).

Предположение о независимости часто нереалистично, поэтому метод называется «наивным». Но он очень быстрый и исторически хорошо работал для классификации текста.

Сегодня для сложных NLP-задач (обработка задач естественного языка) его во многих случаях заменили нейросетевые методы.

9. Работа с признаками

Пропущенные значения

Если в данных отсутствует значение, возможны разные стратегии:

* удалить строки или признаки;

* заменить средним/медианой;

* использовать наиболее частое значение;

* использовать специальную категорию;

* применить модель для imputation.

Важно не допустить утечки данных (data leakage): статистики для заполнения пропусков нужно рассчитывать только на обучающей выборке.

Категориальные признаки

Категории необходимо преобразовать в числовое представление.

Например:

red, blue, green

→ one-hot encoding.

Для категорий с большим количеством значений могут использоваться target encoding, embeddings и другие подходы.

Масштабирование

Некоторые алгоритмы чувствительны к масштабу признаков.

Например:

age = 30, income = 100000

может привести к тому, что расстояния будут преимущественно определяться доходом.

Поэтому используют:

* StandardScaler;

* MinMaxScaler;

* RobustScaler.

Особенно важно масштабирование для KNN, SVM, PCA и методов, основанных на градиентной оптимизации.

Предсказания сами по себе обычно не масштабируют. Но если масштабируется целевая переменная y при обучении регрессии, после предсказания результат необходимо вернуть в исходный масштаб — сделать inverse transform.

10. Математика в ML

Линейная алгебра

Линейная алгебра — один из математических фундаментальных инструментов ML.

Вектор — одномерный набор чисел:

x = [x₁, x₂, x₃]

Например, характеристики одного объекта.

Матрица — двумерная таблица чисел:

X = строки × признаки.

Например, вся обучающая выборка.

В ML матрицы используются для хранения данных, а векторы — для представления объектов, параметров и эмбеддингов.

Матричные операции лежат в основе нейронных сетей:

y = Wx + b

где W — матрица весов.

Апроксимация данных

Апроксимация — построение функции, которая приближённо описывает реальные данные.

Например, линейная регрессия пытается найти линию, которая наилучшим образом приближает наблюдения.

11. Параметрические и непараметрические модели

Параметрическая модель предполагает определённую форму зависимости и имеет фиксированное количество параметров.

Пример — линейная регрессия:

y = wx + b.

Непараметрическая модель не задаёт заранее жёсткую форму зависимости и может становиться сложнее с увеличением данных.

Пример — KNN.

Важно: «непараметрическая» не означает «без параметров». Это означает, что сложность модели не фиксирована заранее таким же образом, как в параметрических моделях.

12. Lasso и отбор признаков

Lasso regression добавляет к функции ошибки L1-регуляризацию:

Loss = ошибка + λΣ|wᵢ|

Она заставляет часть коэффициентов становиться равной нулю.

Поэтому Lasso может одновременно:

* бороться с переобучением;

* уменьшать сложность модели;

* выполнять автоматический отбор признаков.

Признаки с наибольшей прогностической ценностью — это признаки, которые дают наибольший вклад в качество предсказания. Но важно различать корреляцию и причинность: сильный предиктор не обязательно является причиной результата.

13. Как определить тональность отзыва?

Это задача классификации текста.

Классический pipeline:

текст → очистка/токенизация → TF-IDF → классификатор → positive/negative/neutral.

Можно использовать Logistic Regression, Naive Bayes или SVM.

Современный pipeline:

текст → embedding/Transformer → классификация.

Для сложного анализа тональности современные трансформер-модели обычно значительно эффективнее классических Bag-of-Words/TF-IDF подходов.

Самое важное, что стоит запомнить:

1. K-ближайших соседей (KNN, K-Nearest Neighbors) — обучение с учителем (supervised learning), а не без учителя.

2. Метод K-средних (K-means) и метод гауссовских смесей (GMM, Gaussian Mixture Model) — методы кластеризации (clustering) в обучении без учителя (unsupervised learning).

3. TF-IDF (term frequency–inverse document frequency), мешок слов (Bag-of-Words) и латентно-семантический анализ (LSA, Latent Semantic Analysis) — классические методы обработки естественного языка (NLP, Natural Language Processing). Векторные представления (embeddings) и трансформеры (transformers) — более современные подходы.

4. Метод главных компонент (PCA, Principal Component Analysis) — метод преимущественно линейного снижения размерности (dimensionality reduction). UMAP (Uniform Manifold Approximation and Projection) и t-SNE (t-distributed Stochastic Neighbor Embedding) — преимущественно нелинейные методы, особенно полезные для визуализации (visualization).

5. Случайный лес (Random Forest) использует бэггинг (bagging) — объединение множества моделей, обученных на различных подвыборках. Бустинг (Boosting) строит модели последовательно, где следующие модели стараются исправить ошибки предыдущих.

6. Метод Лассо (Lasso Regression) использует L1-регуляризацию (L1 regularization) и может занулять коэффициенты признаков. Поэтому он одновременно помогает бороться с переобучением (overfitting) и выполнять отбор признаков (feature selection).

7. Обычно масштабируют признаки (features), а не сами предсказания. Если при обучении регрессии была масштабирована целевая переменная (target variable), после предсказания результат необходимо вернуть в исходный масштаб с помощью обратного преобразования (inverse transform).

© TheStatusSymbol.com 2017-2027. 16+ All Rights Reserved.

hello@thestatussymbol.com

 

Scroll To Top