Glossary (Словарь)
Англо-русский словарь важных терминов в области ML/AI/MLOps. Для каждого термина — краткое объяснениеи контекст.
A
- Activation function(функция активации) — функция, добавляющая nonlinearity в neural network (ReLU, Sigmoid, Tanh).
- AdamW — Adam optimizer + better weight decay; современный default.
- Agent (AI Agent) — LLM + tools + memory; последовательные действия для достижения цели.
- Anchor box — predefined bounding box shape в object detection.
- ANN (Approximate Nearest Neighbor) — быстрый поиск близких векторов (HNSW, IVF).
- API (Application Programming Interface) — интерфейс программирования.
- Async / await — concurrent operations в Python.
- Attention mechanism — направление «внимания» на важные части sequence.
- AUC (Area Under Curve) — площадь под ROC curve (classification metric).
- AutoGrad — механизм автоматического расчёта gradient в PyTorch.
B
- Backpropagation — обратное распространение gradient; алгоритм обучения neural network.
- Bagging (Bootstrap Aggregating) — parallel ensemble (основа Random Forest).
- Batch — набор sample, передаваемых модели одновременно.
- Batch Normalization (BN) — нормализация activation внутри batch.
- Bayesian Optimization — умный поиск hyperparameter (Optuna).
- Bias (математический) — constant, добавляемый к output модели.
- Bias (вывод) — склонность алгоритма к неправильным prediction.
- Boosting — sequential ensemble (XGBoost, LightGBM).
- BPE (Byte-Pair Encoding) — subword tokenization (в GPT, Llama).
- Broadcasting — операция над tensor разной shape в NumPy/PyTorch.
C
- Calibration — приведение probabilities модели к надёжному виду.
- Canary deployment — тестирование новой версии на маленьком traffic.
- Categorical feature — feature с дискретными значениями (city, color).
- Chain-of-Thought (CoT) — prompt со step-by-step reasoning в LLM.
- Checkpoint — сохранение state модели (для resume training).
- Classification — разделение sample на дискретные class.
- Clustering — группировка похожих (unsupervised).
- CNN (Convolutional NN) — neural network для image processing.
- Cold start — проблема отсутствия данных о новом user/item.
- Concept drift — изменение input → output relationship со временем.
- Confusion Matrix — таблица с TP, FP, TN, FN.
- Context window — количество токенов, видимых LLM одновременно.
- Cosine similarity — cos угла между двумя векторами.
- CRD (Custom Resource Definition) — custom объект Kubernetes.
- Cross-encoder — classifier для sentence pair (в reranking).
- Cross-validation (CV) — оценка модели на нескольких частях.
- CUDA — parallel computation на NVIDIA GPU.
D
- DAG (Directed Acyclic Graph) — представление workflow в Airflow.
- Data augmentation — искусственное расширение training data.
- Data drift — изменение input distribution со временем.
- Data leakage — «утечка» test/validation data в training (ошибка).
- DataFrame — табличная data structure в Pandas.
- DataLoader — загрузка batch в PyTorch.
- Decision Tree — классический ML алгоритм на дереве правил.
- Deep Learning (DL) — глубокие (многослойные) neural network.
- DevOps — интеграция software development + operations.
- Diffusion model — image generation (Stable Diffusion, DALL-E).
- Dimensionality reduction — уменьшение количества feature (PCA, t-SNE).
- Docker — application containerization.
- Dropout — случайное «отключение» neuron для уменьшения overfitting.
- DVC (Data Version Control) — Git for data.
E
- EDA (Exploratory Data Analysis) — этап анализа данных.
- Embedding — преобразование дискретного объекта в dense вектор.
- Encoder-Decoder — архитектура translation/summarization.
- Ensemble — несколько моделей вместе.
- Epoch — однократное training по всему dataset.
- Evaluation — измерение качества модели.
- Evidently AI — tool для drift detection и monitoring.
F
- F1 Score — harmonic mean precision и recall.
- FastAPI — современный Python web framework (на основе Pydantic).
- Feature — каждое измерение в input модели.
- Feature engineering — создание новых feature.
- Feature store — хранение и serving feature (Feast).
- Few-shot learning — обучение на малом числе примеров.
- Fine-tuning — адаптация pretrained модели к своей task.
- Flask — micro web framework (стандарт до FastAPI).
- F-score — общий случай F1 (с параметром beta).
- Function calling / Tool use — разрешение LLM вызывать внешние function.
G
- GAN (Generative Adversarial Network) — generator + discriminator.
- Gemini — семейство LLM от Google.
- Generative AI — AI, создающий content (текст, изображение, аудио).
- Gini index — split quality в Decision Tree.
- GitHub Actions — CI/CD platform.
- GPT (Generative Pretrained Transformer) — семейство LLM OpenAI.
- GPU (Graphics Processing Unit) — для parallel computation.
- Gradient — направление самого быстрого роста функции.
- Gradient Boosting — sequential boosting алгоритм.
- Gradient Descent — алгоритм минимизации loss.
- Grafana — monitoring dashboard.
- GridSearch — exhaustive поиск hyperparameter.
H
- Hallucination — уверенный, но неправильный ответ LLM.
- Helm — package manager Kubernetes.
- HNSW (Hierarchical Navigable Small Worlds) — fast ANN algorithm.
- HPA (Horizontal Pod Autoscaler) — auto-scaling Kubernetes.
- HuggingFace — платформа для ML моделей и datasets.
- Hybrid search — поиск vector + keyword (BM25).
- HyDE (Hypothetical Document Embeddings) — RAG техника.
- Hyperparameter — параметр, заданный до training (lr, batch).
I
- Image segmentation — pixel-level classification.
- Imbalanced data — количества class неравны.
- Inference — prediction с помощью модели.
- Ingress — внешний HTTP routing Kubernetes.
- Instance segmentation — отдельный mask для каждого object.
- Instruction tuning — fine-tuning с instructions.
- IoU (Intersection over Union) — object detection metric.
J
- Jupyter Notebook — interactive Python environment.
K
- Keras — high-level NN API (в TensorFlow).
- K-Fold Cross-validation — разделение dataset на K fold.
- K-Means — clustering алгоритм.
- KNN (K-Nearest Neighbors) — classification на основе K ближайших sample.
- Kubernetes (K8s) — container orchestration.
- Kubeflow — Kubernetes-native ML platform.
L
- L1, L2 regularization — Lasso (L1), Ridge (L2).
- LangChain — LLM application framework.
- LangGraph — stateful multi-agent workflows.
- Langfuse — LLM observability platform.
- LayerNorm — Layer normalization (в Transformer).
- Learning rate (lr) — размер шага gradient descent.
- LightGBM — fast gradient boosting (Microsoft).
- Linear Regression — самый простой regression алгоритм.
- LLM (Large Language Model) — большая языковая модель.
- LlamaIndex — RAG framework.
- LoRA (Low-Rank Adaptation) — efficient fine-tuning.
- Loss function — функция, измеряющая ошибку модели.
M
- MAE (Mean Absolute Error) — regression metric.
- MAP (mean Average Precision) — object detection metric.
- MAPE (Mean Absolute Percentage Error) — ошибка в %.
- MCP (Model Context Protocol) — стандарт agent tool от Anthropic.
- MinMaxScaler — приведение feature к [0, 1].
- MLflow — платформа для experiment tracking.
- MLOps — интеграция ML + DevOps.
- Model registry — хранение версионированных моделей.
- MSE (Mean Squared Error) — regression loss.
- Multi-class classification — выбор среди 3+ class.
- Multi-label classification — несколько label для одного sample.
- Multi-task learning — одна модель для нескольких task.
N
- N-gram — N consecutive слов.
- Naive Bayes — probabilistic classifier (популярен для text).
- NER (Named Entity Recognition) — именованные объекты в тексте.
- Neural Network (NN) — сеть взаимосвязанных neuron.
- NLP (Natural Language Processing) — работа с текстом.
- NMS (Non-Maximum Suppression) — фильтрация overlapping detection.
- Normalization — приведение feature к одинаковой scale.
- NumPy — numerical computation library.
O
- One-Hot Encoding — categorical → binary вектор.
- ONNX (Open Neural Network Exchange) — cross-framework формат модели.
- OpenAI — компания-создатель GPT.
- Optimizer — как применять gradient (SGD, Adam, AdamW).
- Optuna — Bayesian hyperparameter tuning.
- Overfitting — модель хороша на train, плоха на test.
P
- Pandas — tabular data manipulation.
- Parameter — обучаемое значение модели (weight).
- PCA (Principal Component Analysis) — dimensionality reduction.
- PEFT (Parameter-Efficient Fine-Tuning) — LoRA, QLoRA и т.д.
- Perceptron — самый простой neuron.
- Pipeline — preprocessing + model в sklearn.
- Pod — самая маленькая unit в Kubernetes.
- Pooling — downsampling в CNN (MaxPool, AvgPool).
- POS tagging (Part-Of-Speech) — определение частей речи.
- Postgres / PostgreSQL — relational database.
- Precision — TP / (TP + FP).
- Prefect — современный workflow orchestrator.
- Pretrained model — модель, предобученная на большом corpus.
- Prompt — input текст, передаваемый LLM.
- Prompt engineering — искусство написания хорошего prompt.
- Prometheus — metrics monitoring system.
- PSI (Population Stability Index) — drift detection metric.
- Pydantic — Python data validation.
- PyTorch — deep learning framework.
Q
- QLoRA — 4-bit quantization + LoRA.
- Qdrant — vector database (Rust).
- Quantization — уменьшение precision модели (8-bit, 4-bit).
- Query — вопрос, передаваемый LLM/search.
R
- R² — coefficient of determination (regression).
- RAG (Retrieval Augmented Generation) — LLM + knowledge retrieval.
- RAGAS — framework для RAG evaluation.
- Random Forest — bagging Decision Trees.
- RandomizedSearch — random поиск hyperparameter.
- Recall — TP / (TP + FN).
- Recommender system — система рекомендаций.
- ReAct (Reasoning + Acting) — agent pattern.
- Recurrent Neural Network (RNN) — NN для sequence.
- Redis — in-memory database.
- Regex (Regular Expression) — pattern matching.
- Regression — bashорат непрерывного значения.
- Regularization — уменьшение overfitting (L1, L2, Dropout).
- Reranking — переупорядочивание search результатов.
- REST API — HTTP-based API standard.
- ResNet — CNN со skip connections.
- RLHF (Reinforcement Learning from Human Feedback) — LLM alignment.
- RMSE (Root Mean Squared Error) — sqrt(MSE).
- ROC-AUC — Receiver Operating Characteristic Area Under Curve.
S
- SageMaker — AWS ML platform.
- Scaler — feature normalization (Standard, MinMax).
- scikit-learn — Python ML library.
- Self-attention — attention между токенами внутри sequence.
- Self-supervised learning — pretraining без labels.
- Semantic search — поиск по смыслу (vector search).
- Sentence Transformer — sentence embeddings.
- SFT (Supervised Fine-Tuning) — fine-tune с инструкциями.
- SGD (Stochastic Gradient Descent) — классический optimizer.
- SHAP (SHapley Additive exPlanations) — model interpretation.
- Shadow deployment — тест новой модели без traffic.
- Sigmoid — activation function (для binary class).
- Softmax — multi-class output activation.
- spaCy — NLP library.
- Standardization — (x - mean) / std.
- Streaming — real-time response (SSE, WebSocket).
- Supervised learning — обучение с labels.
- SVM (Support Vector Machine) — классический classifier.
T
- Tensor — multi-dimensional array (обобщение NumPy ndarray).
- TensorFlow — DL framework от Google.
- Test set — data, отделённая для финального evaluation.
- TF-IDF — text feature representation.
- Threshold — порог classification decision.
- Token — atomic unit после tokenization.
- Tokenizer — разбиение текста на токены.
- TorchServe — PyTorch production serving.
- Train set — data, на которой обучается модель.
- Transfer learning — применение pretrained модели к своей task.
- Transformer — attention-based архитектура (BERT, GPT).
- Triton — NVIDIA inference server.
U
- Underfitting — модель слишком простая, плоха и на train.
- Unicode — character encoding standard.
- Unsupervised learning — обучение без labels.
V
- Validation set — data для hyperparameter tuning.
- Variance — степень разброса данных.
- Vector — 1-D array.
- Vector Database — хранение embeddings и search.
- ViT (Vision Transformer) — Transformer для изображений.
- vLLM — fastest LLM inference server.
W
- WandB (Weights & Biases) — experiment tracking.
- Weight — neuron coefficient.
- WebSocket — bidirectional connection.
- Word2Vec — word embedding model.
- Workflow orchestration — управление последовательностью task (Airflow).
X
- XGBoost — popular gradient boosting library.
- XLM-R — multilingual RoBERTa.
Y
- YAML — формат config файла.
- YOLO (You Only Look Once) — fast object detection.
Z
- Zero-shot learning — task без примеров через pre-existing knowledge.
Возврат к Главной странице или Ресурсам.