MLOps инженер
Что предстоит делать
Компания – телеком‑оператор, ищет специалиста по MLOps для развёртывания и администрирования ML‑моделей в продакшн‑среду. Задача – упаковывать модели в контейнеры, настраивать inference‑серверы (Triton, TorchServe, BentoML и аналоги), обеспечивать версионирование и воспроизводимость деплоя. Необходимо администрировать GPU‑серверы: установка драйверов NVIDIA, CUDA, cuDNN, конфигурирование GPU‑нод в кластере Kubernetes, диагностика и мониторинг GPU‑оборудования. Создавать и поддерживать CI/CD пайплайны для автоматизированного тестирования, сборки Docker‑образов и деплоя ML‑сервисов в dev, staging и production. Настраивать инфраструктуру мониторинга ML‑сервисов: метрики производительности, латентность, пропускная способность, алертинг в Prometheus/Grafana. Управлять ресурсами GPU‑кластера: планирование нагрузки, распределение GPU между задачами инференса, оптимизация утилизации оборудования и управление очередями задач. Требуется знание Docker, Kubernetes, Helm, MLflow, Triton, BentoML, TorchServe, Python, Bash, GitHub Actions, GitLab CI, Argo Workflows, Prometheus, Grafana, NVIDIA, CUDA, cuDNN, GPU, CI/CD, MLOps и serving‑платформ.
Что мы ждём от кандидата
- Принципы контейнеризации и оркестрации: Docker, Kubernetes, Helm, управление namespace и resource quotas.
- Инструменты MLOps и serving‑платформы: MLflow, Triton Inference Server, BentoML, TorchServe или аналоги.
- Язык программирования Python на уровне написания скриптов автоматизации, работы с API и CLI‑инструментами; основы Bash/Shell scripting.
- Администрирование GPU‑серверов: установка и настройка драйверов NVIDIA, CUDA, cuDNN; мониторинг и оптимизация утилизации GPU (nvidia-smi, DCGM).
- Построение CI/CD пайплайнов для ML: GitHub Actions, GitLab CI, Argo Workflows или аналогов.
- Системы мониторинга и алертинга: Prometheus, Grafana, настройка дашбордов и алертов для ML‑сервисов.
Что предлагаем
- Гибридный формат работы
- Астана/Алматы, Казахстан
- Full time
О Deffic
Откликнитесь на сайте работодателя.