• Текущая инфраструктура:
    • ~50 серверов (Hetzner dedicated + VPS, DigitalOcean).
    • Staging: Docker Swarm.
    • Production: Docker Compose.
    • БД: MariaDB с Master-Slave репликацией.
    • CI/CD: GitLab, Harbor registry.
    • IaC: начальная стадия внедрения, Ansible для конфигурации серверов.
  • Задачи:
    • Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
    • Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
    • Внедрение централизованного логирования.
    • Развитие Infrastructure as Code с использованием Ansible и Terraform.
    • Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
    • Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
    • Security hardening инфраструктуры.
    • Внедрение SLI/SLO и подготовка к работе по SLA.
  • Требования:
    • Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
    • Уверенное владение Ansible.
    • Опыт построения monitoring stack (Prometheus + Grafana).
    • Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга.
    • Опыт с GitLab CI/CD.
    • Администрирование MariaDB/MySQL (репликация, backup, восстановление).
    • Опыт построения централизованного логирования (ELK/Loki).
    • Опыт работы SRE: диагностика и устранение инцидентов в production.
    • Умение самостоятельно принимать технические решения и нести ответственность за их результат.

    Обязательно:
    • On-call 24/7 (инциденты требуют быстрой реакции, включая выходные).
    • Автономность в принятии решений.
    • Ответственность за стабильность инфраструктуры.

    Будет плюсом:
    • Опыт работы с Terraform.
    • Опыт миграции проектов с Docker Compose или Docker Swarm в Kubernetes.
    • Опыт работы с Helm и Argo CD.
    • Опыт с security best practices (secrets management, SSL/TLS, firewall)
    • Опыт работы с высоконагруженными системами.
    • Опыт в iGaming или Fintech (требования к uptime).
    • Опыт построения или развития DevOps/SRE-команды.
  • Дежурства и ответственность:
    • Участие в графике on-call-дежурств.
    • Оперативная реакция на критические production-инциденты, в том числе за пределами стандартного рабочего времени.
    • Автономность в принятии решений
    • Ответственность за доступность и стабильность инфраструктуры.
    • Проведение postmortem-разборов и устранение первопричин инцидентов.

Что мы предлагаем:

  • Remote-first
    Работа из любой точки мира.
  • Отдых
    18 рабочих дней отпуска, 5 оплачиваемых sick days, 2 дополнительных day off в год и оплачиваемый больничный

  • График
    С 10:00 до 19:00 (gmt+3)
  • Бонусы
    Подарки ко дню рождения, на годовщину работы и по важным жизненным событиям.
  • Испытательный срок
    3 месяца, с возможностью сокращения по результатам работы.
  • Развитие
    Ежемесячный бюджет на обучение и профессиональное развитие
ОТПРАВЛЯЙТЕ РЕЗЮМЕ В ТГ:
@Elena_ComboTech

This site was made on Tilda — a website builder that helps to create a website without any code
Create a website