Месяц 4 — Computer Vision + NLP
🎯 Цель этого месяца
К концу месяца вы сможете:
- Классический image processing с OpenCV
- Object detection с YOLO и другими pretrained моделями
- Извлечение текста с помощью OCR (Tesseract, EasyOCR, PaddleOCR)
- Предобработка текста с spaCy и NLTK
- Применение BERT-style моделей через HuggingFace Transformers
Распределение по неделям
| Неделя | Тема | Время |
|---|---|---|
| Неделя 1 | OpenCV + Image Processing | 10-12 часов |
| Неделя 2 | YOLO, Detection, Segmentation, OCR | 10-12 часов |
| Неделя 3 | Основы NLP + предобработка текста | 10-12 часов |
| Неделя 4 | Transformers + HuggingFace | 10-12 часов |
Порядок глав
- Введение в Computer Vision
- Работа с OpenCV
- YOLO и Object Detection
- Основы NLP
- Предобработка текста
- Введение в Transformers
- Упражнения
Что вы сможете делать в конце месяца?
- FastAPI-сервис, принимающий upload изображений/видео и возвращающий object detection через YOLO
- OCR-сервис — извлечение данных из паспортов и ID-карт
- Sentiment analyzer и NER с HuggingFace pretrained моделями
- Полностью готовы к месяцу 5 (LLM/RAG)
Совет для Backend Dev
В этом месяце в основном используются pretrained модели:
- ResNet/EfficientNet (месяц 3) — для image classification
- YOLO — object detection
- Segment Anything (SAM) — segmentation
- BERT/RoBERTa — text understanding
- Whisper — speech-to-text
- Stable Diffusion — image generation
Ваша задача — вывести эти модели в production, сделать fine-tune для вашего родного языка (узбекский), интегрировать с экосистемой FastAPI/Django.
Начать
Начните с раздела Введение в Computer Vision.