- Требуемый опыт работы: от 4 лет
- Локация: Беларусь, Россия, Казахстан
Что предстоит делать:
- Разворачивать и сопровождать сервисы GenAI-платформы в Kubernetes on-prem и в Yandex Cloud: API-сервисы, Agent Runtime, RAG, очереди, базы данных, observability-компоненты.
- Развивать инфраструктуру как код: Helm, Kustomize, Terraform или аналогичные инструменты; обеспечивать воспроизводимость окружений dev, test, stage и production.
- Настраивать и поддерживать CI/CD: сборка образов, проверки качества и безопасности, публикация в registry, rollout/rollback, контроль версий конфигураций.
- Обеспечивать сетевую связанность и безопасные границы между on-prem и Yandex Cloud: DNS, ingress, TLS, маршрутизация, VPN/выделенные каналы, сегментация и управление секретами.
- Настраивать мониторинг, логирование и трассировку: метрики доступности и производительности, SLI/SLO, alerting, анализ инцидентов и capacity planning.
- Сопровождать работу GPU- и CPU-нагрузок, включая планирование ресурсов, autoscaling, очереди и изоляцию сервисов inference, sandbox и batch-задач.
- Работать с командами разработки, data/ML и ИБ: определять эксплуатационные требования, проводить технические ревью, участвовать в аварийных работах и postmortem.
Мы ожидаем:
- Опыт DevOps/SRE от 4 лет и уверенная практическая работа с Linux, Docker и Kubernetes.
- Практический опыт администрирования Kubernetes-кластеров и доставки приложений через Helm или Kustomize.
- Опыт с Yandex Cloud или другим публичным облаком: Kubernetes, контейнерный registry, сети, IAM, object storage, мониторинг и управление доступами.
- Уверенное владение CI/CD-инструментами: GitLab CI, Jenkins, Argo CD или аналогами; понимание GitOps-подхода.
- Опыт Terraform, Ansible или других IaC-инструментов.
- Понимание сетей, TLS, reverse proxy, ingress, DNS, балансировки нагрузки и принципов zero trust.
- Практический опыт с Prometheus, Grafana, Loki/ELK, OpenTelemetry или аналогичными инструментами наблюдаемости.
- Понимание принципов безопасной эксплуатации: RBAC, secrets management, image scanning, vulnerability management, backup и disaster recovery.
Будет плюсом:
- Опыт эксплуатации GPU-нагрузок, model serving, vLLM/TGI/Triton или аналогичных inference-сервисов.
- Опыт с Kafka/RabbitMQ, PostgreSQL, Redis, S3-совместимым хранилищем и service mesh.
- Знание OPA, Vault, Keycloak, Istio или аналогичных средств policy enforcement и контроля доступа.
- Опыт работы в промышленной компании, в изолированных сегментах и средах с повышенными требованиями к ИБ
Мы предлагаем:
- Работу в стабильной компании (24 года на рынке IT-решений, резидент ПВТ).
- Помощь и поддержку в профессиональном и карьерном росте (индивидуальный план развития, менторинг, внутренняя система обучения).
- Дружественную атмосферу в команде и работу с отличными специалистами.
- Зарубежные конференции за счёт компании.
- Программу компенсаций профессиональных сертификатов.
- Хороший соцпакет (бесплатные корпоративные курсы английского языка, компенсация сумм спортивных абонементов, программа лояльности, медицинское страхование и т.д.) и отличные вечеринки.
*Ссылка на Общереспубликанский банк вакансий на информационном портале государственной службы занятости не размещается на основании абз. 5 ст. 34 закона Республики Беларусь “О занятости населения”.