Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

Glossary (Словарь)

Англо-русский словарь важных терминов в области ML/AI/MLOps. Для каждого термина — краткое объяснениеи контекст.

A

  • Activation function(функция активации) — функция, добавляющая nonlinearity в neural network (ReLU, Sigmoid, Tanh).
  • AdamW — Adam optimizer + better weight decay; современный default.
  • Agent (AI Agent) — LLM + tools + memory; последовательные действия для достижения цели.
  • Anchor box — predefined bounding box shape в object detection.
  • ANN (Approximate Nearest Neighbor) — быстрый поиск близких векторов (HNSW, IVF).
  • API (Application Programming Interface) — интерфейс программирования.
  • Async / await — concurrent operations в Python.
  • Attention mechanism — направление «внимания» на важные части sequence.
  • AUC (Area Under Curve) — площадь под ROC curve (classification metric).
  • AutoGrad — механизм автоматического расчёта gradient в PyTorch.

B

  • Backpropagation — обратное распространение gradient; алгоритм обучения neural network.
  • Bagging (Bootstrap Aggregating) — parallel ensemble (основа Random Forest).
  • Batch — набор sample, передаваемых модели одновременно.
  • Batch Normalization (BN) — нормализация activation внутри batch.
  • Bayesian Optimization — умный поиск hyperparameter (Optuna).
  • Bias (математический) — constant, добавляемый к output модели.
  • Bias (вывод) — склонность алгоритма к неправильным prediction.
  • Boosting — sequential ensemble (XGBoost, LightGBM).
  • BPE (Byte-Pair Encoding) — subword tokenization (в GPT, Llama).
  • Broadcasting — операция над tensor разной shape в NumPy/PyTorch.

C

  • Calibration — приведение probabilities модели к надёжному виду.
  • Canary deployment — тестирование новой версии на маленьком traffic.
  • Categorical feature — feature с дискретными значениями (city, color).
  • Chain-of-Thought (CoT) — prompt со step-by-step reasoning в LLM.
  • Checkpoint — сохранение state модели (для resume training).
  • Classification — разделение sample на дискретные class.
  • Clustering — группировка похожих (unsupervised).
  • CNN (Convolutional NN) — neural network для image processing.
  • Cold start — проблема отсутствия данных о новом user/item.
  • Concept drift — изменение input → output relationship со временем.
  • Confusion Matrix — таблица с TP, FP, TN, FN.
  • Context window — количество токенов, видимых LLM одновременно.
  • Cosine similarity — cos угла между двумя векторами.
  • CRD (Custom Resource Definition) — custom объект Kubernetes.
  • Cross-encoder — classifier для sentence pair (в reranking).
  • Cross-validation (CV) — оценка модели на нескольких частях.
  • CUDA — parallel computation на NVIDIA GPU.

D

  • DAG (Directed Acyclic Graph) — представление workflow в Airflow.
  • Data augmentation — искусственное расширение training data.
  • Data drift — изменение input distribution со временем.
  • Data leakage — «утечка» test/validation data в training (ошибка).
  • DataFrame — табличная data structure в Pandas.
  • DataLoader — загрузка batch в PyTorch.
  • Decision Tree — классический ML алгоритм на дереве правил.
  • Deep Learning (DL) — глубокие (многослойные) neural network.
  • DevOps — интеграция software development + operations.
  • Diffusion model — image generation (Stable Diffusion, DALL-E).
  • Dimensionality reduction — уменьшение количества feature (PCA, t-SNE).
  • Docker — application containerization.
  • Dropout — случайное «отключение» neuron для уменьшения overfitting.
  • DVC (Data Version Control) — Git for data.

E

  • EDA (Exploratory Data Analysis) — этап анализа данных.
  • Embedding — преобразование дискретного объекта в dense вектор.
  • Encoder-Decoder — архитектура translation/summarization.
  • Ensemble — несколько моделей вместе.
  • Epoch — однократное training по всему dataset.
  • Evaluation — измерение качества модели.
  • Evidently AI — tool для drift detection и monitoring.

F

  • F1 Score — harmonic mean precision и recall.
  • FastAPI — современный Python web framework (на основе Pydantic).
  • Feature — каждое измерение в input модели.
  • Feature engineering — создание новых feature.
  • Feature store — хранение и serving feature (Feast).
  • Few-shot learning — обучение на малом числе примеров.
  • Fine-tuning — адаптация pretrained модели к своей task.
  • Flask — micro web framework (стандарт до FastAPI).
  • F-score — общий случай F1 (с параметром beta).
  • Function calling / Tool use — разрешение LLM вызывать внешние function.

G

  • GAN (Generative Adversarial Network) — generator + discriminator.
  • Gemini — семейство LLM от Google.
  • Generative AI — AI, создающий content (текст, изображение, аудио).
  • Gini index — split quality в Decision Tree.
  • GitHub Actions — CI/CD platform.
  • GPT (Generative Pretrained Transformer) — семейство LLM OpenAI.
  • GPU (Graphics Processing Unit) — для parallel computation.
  • Gradient — направление самого быстрого роста функции.
  • Gradient Boosting — sequential boosting алгоритм.
  • Gradient Descent — алгоритм минимизации loss.
  • Grafana — monitoring dashboard.
  • GridSearch — exhaustive поиск hyperparameter.

H

  • Hallucination — уверенный, но неправильный ответ LLM.
  • Helm — package manager Kubernetes.
  • HNSW (Hierarchical Navigable Small Worlds) — fast ANN algorithm.
  • HPA (Horizontal Pod Autoscaler) — auto-scaling Kubernetes.
  • HuggingFace — платформа для ML моделей и datasets.
  • Hybrid search — поиск vector + keyword (BM25).
  • HyDE (Hypothetical Document Embeddings) — RAG техника.
  • Hyperparameter — параметр, заданный до training (lr, batch).

I

  • Image segmentation — pixel-level classification.
  • Imbalanced data — количества class неравны.
  • Inference — prediction с помощью модели.
  • Ingress — внешний HTTP routing Kubernetes.
  • Instance segmentation — отдельный mask для каждого object.
  • Instruction tuning — fine-tuning с instructions.
  • IoU (Intersection over Union) — object detection metric.

J

  • Jupyter Notebook — interactive Python environment.

K

  • Keras — high-level NN API (в TensorFlow).
  • K-Fold Cross-validation — разделение dataset на K fold.
  • K-Means — clustering алгоритм.
  • KNN (K-Nearest Neighbors) — classification на основе K ближайших sample.
  • Kubernetes (K8s) — container orchestration.
  • Kubeflow — Kubernetes-native ML platform.

L

  • L1, L2 regularization — Lasso (L1), Ridge (L2).
  • LangChain — LLM application framework.
  • LangGraph — stateful multi-agent workflows.
  • Langfuse — LLM observability platform.
  • LayerNorm — Layer normalization (в Transformer).
  • Learning rate (lr) — размер шага gradient descent.
  • LightGBM — fast gradient boosting (Microsoft).
  • Linear Regression — самый простой regression алгоритм.
  • LLM (Large Language Model) — большая языковая модель.
  • LlamaIndex — RAG framework.
  • LoRA (Low-Rank Adaptation) — efficient fine-tuning.
  • Loss function — функция, измеряющая ошибку модели.

M

  • MAE (Mean Absolute Error) — regression metric.
  • MAP (mean Average Precision) — object detection metric.
  • MAPE (Mean Absolute Percentage Error) — ошибка в %.
  • MCP (Model Context Protocol) — стандарт agent tool от Anthropic.
  • MinMaxScaler — приведение feature к [0, 1].
  • MLflow — платформа для experiment tracking.
  • MLOps — интеграция ML + DevOps.
  • Model registry — хранение версионированных моделей.
  • MSE (Mean Squared Error) — regression loss.
  • Multi-class classification — выбор среди 3+ class.
  • Multi-label classification — несколько label для одного sample.
  • Multi-task learning — одна модель для нескольких task.

N

  • N-gram — N consecutive слов.
  • Naive Bayes — probabilistic classifier (популярен для text).
  • NER (Named Entity Recognition) — именованные объекты в тексте.
  • Neural Network (NN) — сеть взаимосвязанных neuron.
  • NLP (Natural Language Processing) — работа с текстом.
  • NMS (Non-Maximum Suppression) — фильтрация overlapping detection.
  • Normalization — приведение feature к одинаковой scale.
  • NumPy — numerical computation library.

O

  • One-Hot Encoding — categorical → binary вектор.
  • ONNX (Open Neural Network Exchange) — cross-framework формат модели.
  • OpenAI — компания-создатель GPT.
  • Optimizer — как применять gradient (SGD, Adam, AdamW).
  • Optuna — Bayesian hyperparameter tuning.
  • Overfitting — модель хороша на train, плоха на test.

P

  • Pandas — tabular data manipulation.
  • Parameter — обучаемое значение модели (weight).
  • PCA (Principal Component Analysis) — dimensionality reduction.
  • PEFT (Parameter-Efficient Fine-Tuning) — LoRA, QLoRA и т.д.
  • Perceptron — самый простой neuron.
  • Pipeline — preprocessing + model в sklearn.
  • Pod — самая маленькая unit в Kubernetes.
  • Pooling — downsampling в CNN (MaxPool, AvgPool).
  • POS tagging (Part-Of-Speech) — определение частей речи.
  • Postgres / PostgreSQL — relational database.
  • Precision — TP / (TP + FP).
  • Prefect — современный workflow orchestrator.
  • Pretrained model — модель, предобученная на большом corpus.
  • Prompt — input текст, передаваемый LLM.
  • Prompt engineering — искусство написания хорошего prompt.
  • Prometheus — metrics monitoring system.
  • PSI (Population Stability Index) — drift detection metric.
  • Pydantic — Python data validation.
  • PyTorch — deep learning framework.

Q

  • QLoRA — 4-bit quantization + LoRA.
  • Qdrant — vector database (Rust).
  • Quantization — уменьшение precision модели (8-bit, 4-bit).
  • Query — вопрос, передаваемый LLM/search.

R

  • — coefficient of determination (regression).
  • RAG (Retrieval Augmented Generation) — LLM + knowledge retrieval.
  • RAGAS — framework для RAG evaluation.
  • Random Forest — bagging Decision Trees.
  • RandomizedSearch — random поиск hyperparameter.
  • Recall — TP / (TP + FN).
  • Recommender system — система рекомендаций.
  • ReAct (Reasoning + Acting) — agent pattern.
  • Recurrent Neural Network (RNN) — NN для sequence.
  • Redis — in-memory database.
  • Regex (Regular Expression) — pattern matching.
  • Regression — bashорат непрерывного значения.
  • Regularization — уменьшение overfitting (L1, L2, Dropout).
  • Reranking — переупорядочивание search результатов.
  • REST API — HTTP-based API standard.
  • ResNet — CNN со skip connections.
  • RLHF (Reinforcement Learning from Human Feedback) — LLM alignment.
  • RMSE (Root Mean Squared Error) — sqrt(MSE).
  • ROC-AUC — Receiver Operating Characteristic Area Under Curve.

S

  • SageMaker — AWS ML platform.
  • Scaler — feature normalization (Standard, MinMax).
  • scikit-learn — Python ML library.
  • Self-attention — attention между токенами внутри sequence.
  • Self-supervised learning — pretraining без labels.
  • Semantic search — поиск по смыслу (vector search).
  • Sentence Transformer — sentence embeddings.
  • SFT (Supervised Fine-Tuning) — fine-tune с инструкциями.
  • SGD (Stochastic Gradient Descent) — классический optimizer.
  • SHAP (SHapley Additive exPlanations) — model interpretation.
  • Shadow deployment — тест новой модели без traffic.
  • Sigmoid — activation function (для binary class).
  • Softmax — multi-class output activation.
  • spaCy — NLP library.
  • Standardization — (x - mean) / std.
  • Streaming — real-time response (SSE, WebSocket).
  • Supervised learning — обучение с labels.
  • SVM (Support Vector Machine) — классический classifier.

T

  • Tensor — multi-dimensional array (обобщение NumPy ndarray).
  • TensorFlow — DL framework от Google.
  • Test set — data, отделённая для финального evaluation.
  • TF-IDF — text feature representation.
  • Threshold — порог classification decision.
  • Token — atomic unit после tokenization.
  • Tokenizer — разбиение текста на токены.
  • TorchServe — PyTorch production serving.
  • Train set — data, на которой обучается модель.
  • Transfer learning — применение pretrained модели к своей task.
  • Transformer — attention-based архитектура (BERT, GPT).
  • Triton — NVIDIA inference server.

U

  • Underfitting — модель слишком простая, плоха и на train.
  • Unicode — character encoding standard.
  • Unsupervised learning — обучение без labels.

V

  • Validation set — data для hyperparameter tuning.
  • Variance — степень разброса данных.
  • Vector — 1-D array.
  • Vector Database — хранение embeddings и search.
  • ViT (Vision Transformer) — Transformer для изображений.
  • vLLM — fastest LLM inference server.

W

  • WandB (Weights & Biases) — experiment tracking.
  • Weight — neuron coefficient.
  • WebSocket — bidirectional connection.
  • Word2Vec — word embedding model.
  • Workflow orchestration — управление последовательностью task (Airflow).

X

  • XGBoost — popular gradient boosting library.
  • XLM-R — multilingual RoBERTa.

Y

  • YAML — формат config файла.
  • YOLO (You Only Look Once) — fast object detection.

Z

  • Zero-shot learning — task без примеров через pre-existing knowledge.

Возврат к Главной странице или Ресурсам.