Files
AWatch-rus/docs/DETMIR_SUPPORT_TASKS_RU.md
T

10 KiB

Задачи поддержки базового комплекса DetMir

Документ описывает задачи сопровождения того комплекса серверов, виртуализации, сетевых сервисов и прикладного ПО, который существовал до начала разработки AWatch-rus.

AWatch-rus, ActivityWatch-коллекторы, новые дашборды, новые контуры телеметрии, ClickHouse-аналитика AWatch-rus и разработка продукта в этот объем не входят. Их нужно оформлять отдельной следующей задачей.

Цель поддержки

Поддержка должна обеспечивать штатную работу базовой ИТ-инфраструктуры DetMir: серверы доступны, виртуальные машины запущены, пользователи могут работать через RDP и прикладное ПО, данные сохраняются, резервные копии создаются, удаленный доступ контролируется, а аварии устраняются с понятной фиксацией причины.

Состав поддерживаемого контура

  • Узел виртуализации и размещенные на нем виртуальные машины или контейнеры.
  • Windows/RDP-серверы и пользовательские рабочие сессии.
  • Существующие прикладные сервисы и связанные файловые каталоги.
  • Существующие базы данных и служебные хранилища, если они уже использовались до проекта AWatch-rus.
  • Сетевой контур: маршрутизация, VPN, firewall, DNS, DHCP, удаленный доступ.
  • Системные сервисы Linux/Windows, планировщики задач и фоновые службы.
  • Резервное копирование, журналы, учетные записи и права доступа.

Ежедневные задачи

  • Проверять доступность ключевых серверов и виртуальных машин.
  • Проверять состояние узла виртуализации: нагрузка CPU/RAM, свободное место, состояние storage, отсутствие зависших VM/CT.
  • Проверять доступность RDP и возможность входа пользователей.
  • Проверять состояние Windows-сервера: свободная память, диск, pagefile, критические ошибки в журналах, зависшие процессы.
  • Проверять работоспособность прикладных сервисов: запуск, доступность, отсутствие явных ошибок в журналах.
  • Проверять сетевую связность между основными узлами, VPN и удаленный доступ.
  • Проверять состояние firewall/NAT/маршрутов, если были жалобы на доступ.
  • Проверять, что критичные systemd services, Windows services и scheduled tasks находятся в ожидаемом состоянии.
  • Проверять наличие свежих резервных копий по базовым системам.
  • Фиксировать найденные проблемы и выполненные действия в журнале поддержки.

Еженедельные задачи

  • Проверять свободное место на всех важных дисках и хранилищах.
  • Проверять накопление старых логов, временных файлов, дампов и архивов.
  • Проверять успешность резервного копирования за неделю.
  • Проверять, что резервные копии реально читаются и доступны для восстановления.
  • Проверять системные журналы Linux/Windows на повторяющиеся ошибки.
  • Проверять состояние учетных записей, срок действия паролей, лишние административные доступы.
  • Проверять стабильность VPN/удаленного доступа и отсутствие неожиданных открытых портов.
  • Готовить короткий отчет владельцу: что проверено, что исправлено, какие риски остаются.

Ежемесячные задачи

  • Проводить контрольный тест восстановления из резервной копии на безопасном участке данных или тестовой копии.
  • Проверять обновления ОС и прикладного ПО, отдельно выделяя безопасные и рискованные обновления.
  • Планировать окно обслуживания для обновлений, перезагрузок и чистки.
  • Проверять состояние сертификатов, доменных имен, VPN-профилей и учетных данных удаленного доступа.
  • Проводить аудит firewall-правил, пробросов портов и внешне доступных сервисов.
  • Обновлять эксплуатационную документацию: IP-адреса, учетные записи без паролей, роли серверов, схемы доступа, процедуры восстановления.
  • Проверять, что нет устаревших или неизвестных сервисов, запущенных без владельца и назначения.

Инцидентные задачи

  • Восстановление доступа к серверу, VM, RDP или прикладному сервису.
  • Устранение нехватки места, памяти, pagefile, зависших процессов и служб.
  • Восстановление работы прикладных сервисов, файловых каталогов, баз данных или сетевых шар.
  • Разбор проблем VPN, маршрутизации, DNS, firewall и удаленного доступа.
  • Восстановление после неудачного обновления, сбоя питания или некорректной перезагрузки.
  • Восстановление данных из резервной копии.
  • Проверка подозрительной активности: неизвестные подключения, новые учетные записи, неожиданные открытые порты, странные scheduled tasks.
  • Подготовка краткого инцидентного отчета: причина, влияние, что сделано, что нужно изменить, чтобы сбой не повторился.

Правила выполнения работ

  • Перед рискованными изменениями делать резервную копию конфигурации или snapshot, если это технически возможно.
  • Не менять сетевые маршруты, firewall, VPN и удаленный доступ без понимания пути отката.
  • Не устанавливать обновления на production без оценки риска и окна обслуживания.
  • Не удалять старые данные и логи без проверки, что они не нужны для бизнеса или расследования.
  • После каждого изменения проверять фактический результат: доступность сервиса, вход пользователя, состояние VM, журнал ошибок, место на диске.
  • Все изменения фиксировать: дата, сервер, действие, причина, результат, способ отката.

Минимальный SLA

  • Плановая проверка: один раз в рабочий день.
  • Реакция на полный простой ключевого сервиса: в течение 2-4 часов.
  • Реакция на частичную деградацию: в течение рабочего дня.
  • Еженедельный отчет владельцу.
  • Плановые изменения только с резервной копией и проверкой результата.
  • После каждого серьезного инцидента: краткий отчет и список мер против повторения.

Что не входит в этот объем

  • Разработка и сопровождение AWatch-rus как продукта.
  • Новые ActivityWatch-коллекторы и новые telemetry pipelines.
  • Новые Grafana-дашборды и управленческая аналитика AWatch-rus.
  • Новые аналитические контуры, созданные специально под AWatch-rus.
  • Коммерческая упаковка, roadmap, CI/CD и разработка новых модулей AWatch-rus.

Эти работы нужно оформлять отдельным приложением к поддержке, когда владелец готов заказывать сопровождение уже разработанной системы AWatch-rus.