Месяц 4 — Сборник упражнений
🟢 Easy
Computer Vision
- Загрузите изображение через OpenCV, преобразуйте в RGB/HSV/Grayscale.
- Canny edge detection + поиск contour.
- Inference для изображения через YOLOv8n pretrained model.
- Top-5 classification для изображения через pretrained EfficientNet.
- OCR для простого изображения с текстом через Tesseract.
NLP
- Tokenization, удаление stop words, lemmatization через NLTK.
- NER и POS tagging через spaCy.
- TF-IDF + Logistic Regression baseline (Spam SMS dataset).
- HuggingFace
pipeline("sentiment-analysis")для 10 предложений. - Cosine similarity matrix между 5 предложениями через Sentence Transformers.
🟡 Medium
CV — Реальные проекты
- Document Scanner: «выпрямление» документа с фото телефона (contour + perspective).
- Custom YOLO training: разметьте 100-200 изображений в Roboflow, fine-tune YOLOv8 (Colab GPU).
- OCR pipeline: извлечение имени, фамилии, номеров с фото паспорта.
- Image similarity search: embed 1000 изображений через pretrained CNN, найдите 10 наиболее близких к query изображению.
- Real-time webcam YOLO: webcam → bounding box + label.
NLP — Реальные проекты
- News classifier: BBC News dataset (5 категорий), сравнение TF-IDF + LR vs BERT.
- Узбекский text dataset: соберите 5000+ постов с Telegram, создайте classifier.
- Multilingual sentiment: одна модель для 3 языков (en/ru/uz).
- Custom BPE tokenizer: обучите BPE для узбекского корпуса.
- Zero-shot classifier: разделите 10 новостей на 5 категорий без “labels”.
🔴 Hard (Production)
1. CV — Object Counter Service
Требования:
- FastAPI + YOLOv8 custom trained model
- Endpoint: image/video upload → count by class
- Celery + Redis (async processing)
- WebSocket real-time updates
- Docker + docker-compose
- Streamlit или React frontend
**Пример use case:**количество машин на parking lot, поток людей в магазине
2. OCR — ID Card Reader
Требования:
- Detect типа ID карты (YOLO)
- Perspective correction (OpenCV)
- Field-by-field OCR (PaddleOCR)
- Validation + parsing (regex)
- Сохранение в PostgreSQL
- REST API + admin panel
3. NLP — Multilingual Customer Support Classifier
Требования:
- Распределение support ticket’ов на 3 языках (en/ru/uz) по 10 категориям
- fine-tune mBERT или XLM-R
- FastAPI + caching
- Prediction monitoring (concept drift detection)
- Telegram bot integration
4. CV+NLP — Visual Question Answering
Требования:
- BLIP или similar VLM (Vision-Language Model)
- Изображение + вопрос → ответ
- Streamlit demo
- Mobile app integration
Мини-проекты
Мини-проект 1: Распознавание узбекских номерных знаков
- Сбор dataset узбекских номерных знаков (100+ изображений с телефона)
- Plate detection через YOLO
- Чтение номера через OCR
- Сервис FastAPI
Мини-проект 2: Receipt Scanner
- OCR фото магазинного чека
- Извлечение товаров и цен
- Итоговая сумма и группировка по категориям
- Telegram bot
Мини-проект 3: Sport Highlights Generator
- Видео футбольного матча
- Object detection (player, ball)
- Event detection (goal, foul)
- Автоматический montage highlights (FFmpeg)
Мини-проект 4: Smart Document Search
- Индексирование 100+ PDF документов
- Sentence embeddings + FAISS
- Natural language search
- Streamlit UI
Quiz
CV
- Разница между Object detection и classification?
- Что такое IoU и mAP?
- Разница в скорости и точности между YOLO и Faster R-CNN?
- Что такое anchor box и как работает anchor-free detector?
- Когда применяется NMS (Non-Maximum Suppression)?
- Разница между Tesseract и современными OCR (EasyOCR/PaddleOCR)?
- Особенность SAM (Segment Anything)?
NLP
- Разница между Stemming и Lemmatization?
- Формула и intuition TF-IDF?
- Разница Skip-gram и CBOW в Word2Vec?
- Разница между BPE и WordPiece tokenization?
- Разница (архитектура) BERT, GPT, T5?
- Что такое Q, K, V в attention mechanism?
- Как работает Zero-shot classification?
Production
- Как вывести pretrained модель в production?
- Почему batching полезен для GPU inference?
- Стратегии Model versioning?
- Как уменьшить размер Docker image для CV сервиса?
- Стратегии caching для NLP сервиса?
✅ Чек-лист конца Месяца 4
- Классический image processing с OpenCV
- YOLOv8 inference и fine-tuning (Colab/Kaggle)
- OCR (хотя бы одна библиотека: Tesseract/EasyOCR/PaddleOCR)
- Классический NLP: TF-IDF + LR baseline
- NER, POS через spaCy
- HuggingFace Transformers (pipeline + Auto*)
- Sentence embeddings (готов к RAG)
- CV или NLP сервис в FastAPI
- Capstone проект на GitHub
- Пост в LinkedIn
Поздравляю! Готовы к Месяц 5 — LLM, RAG и AI Агенты — теперь вы войдёте в эру LLM!