178 lines
15 KiB
Markdown
178 lines
15 KiB
Markdown
# Задачи поддержки базового комплекса DetMir
|
|
|
|
Документ описывает задачи сопровождения того комплекса серверов,
|
|
виртуализации, сетевых сервисов и прикладного ПО, который существовал до
|
|
начала разработки AWatch-rus.
|
|
|
|
AWatch-rus, ActivityWatch-коллекторы, новые дашборды, новые контуры
|
|
телеметрии, ClickHouse-аналитика AWatch-rus и разработка продукта в этот
|
|
объем не входят. Их нужно оформлять отдельной следующей задачей.
|
|
|
|
## Цель поддержки
|
|
|
|
Поддержка должна обеспечивать штатную работу базовой ИТ-инфраструктуры
|
|
DetMir: серверы доступны, виртуальные машины запущены, web-сервер и
|
|
прикладное ПО отвечают штатно, данные сохраняются, резервные копии создаются,
|
|
удаленный доступ контролируется, а аварии устраняются с понятной фиксацией
|
|
причины.
|
|
|
|
## Состав поддерживаемого контура
|
|
|
|
- Узел виртуализации и размещенные на нем виртуальные машины или контейнеры.
|
|
- Web-сервер: HTTP/HTTPS-доступность, виртуальные хосты, TLS-сертификаты,
|
|
reverse proxy, access/error logs и место под web-контент.
|
|
- Существующие прикладные сервисы и связанные файловые каталоги.
|
|
- Существующие базы данных и служебные хранилища, если они уже использовались
|
|
до проекта AWatch-rus.
|
|
- Proxmox: состояние узла, VM/CT, storage, snapshots, backups, web-доступ.
|
|
- pfSense: firewall, NAT, маршрутизация, VLAN/interface status, DHCP, DNS,
|
|
gateway monitoring, логи и правила доступа.
|
|
- OpenVPN: сервер, клиентские профили, сертификаты, маршруты, доступность
|
|
подключений и контроль истекающих ключей.
|
|
- Suricata: состояние IDS/IPS, обновление правил, алерты, false positive,
|
|
исключения и влияние блокировок на рабочий трафик.
|
|
- Сетевой контур: маршрутизация, VPN, firewall, DNS, DHCP, удаленный доступ.
|
|
- Системные сервисы Linux, планировщики задач и фоновые службы.
|
|
- Резервное копирование, журналы, учетные записи и права доступа.
|
|
|
|
## Ежедневные задачи
|
|
|
|
- Проверять доступность ключевых серверов и виртуальных машин.
|
|
- Проверять состояние узла виртуализации: нагрузка CPU/RAM, свободное место,
|
|
состояние storage, отсутствие зависших VM/CT.
|
|
- Проверять Proxmox: состояние node, VM/CT, storage, backup jobs, snapshots и
|
|
ошибки в task log.
|
|
- Проверять web-сервер: HTTP/HTTPS-ответ, корректность виртуальных хостов,
|
|
срок действия TLS-сертификатов, ошибки 4xx/5xx и переполнение access/error
|
|
logs.
|
|
- Проверять работоспособность прикладных сервисов: запуск, доступность,
|
|
отсутствие явных ошибок в журналах.
|
|
- Проверять сетевую связность между основными узлами, VPN и удаленный доступ.
|
|
- Проверять состояние firewall/NAT/маршрутов, если были жалобы на доступ.
|
|
- Проверять pfSense: gateway status, interface status, DHCP leases,
|
|
firewall/NAT rules, логи блокировок по жалобам на доступ.
|
|
- Проверять OpenVPN server и клиентов: активные подключения, маршруты,
|
|
reachability внутренних сетей, ошибки TLS/auth/route push.
|
|
- Проверять Suricata: запущен ли сервис, нет ли массовых блокировок рабочего
|
|
трафика, критичных алертов и переполнения логов.
|
|
- Проверять, что критичные systemd services, timers и cron jobs
|
|
находятся в ожидаемом состоянии.
|
|
- Проверять наличие свежих резервных копий по базовым системам.
|
|
- Фиксировать найденные проблемы и выполненные действия в журнале поддержки.
|
|
|
|
## Еженедельные задачи
|
|
|
|
- Проверять свободное место на всех важных дисках и хранилищах.
|
|
- Проверять накопление старых логов, временных файлов, дампов и архивов.
|
|
- Проверять успешность резервного копирования за неделю.
|
|
- Проверять, что резервные копии реально читаются и доступны для восстановления.
|
|
- Проверять системные журналы Linux и web-сервера на повторяющиеся ошибки.
|
|
- Проверять web-сервер: рост 5xx, подозрительные запросы, устаревающие
|
|
сертификаты, переполнение логов, доступность ключевых URL и корректность
|
|
reverse proxy.
|
|
- Проверять pfSense и сетевые журналы: повторяющиеся блокировки, падение
|
|
gateway, flapping интерфейсов, ошибки DNS/DHCP/VPN.
|
|
- Проверять OpenVPN: список активных клиентов, неиспользуемые профили,
|
|
приближающиеся к истечению сертификаты, корректность клиентских маршрутов.
|
|
- Проверять Suricata alerts: отделять реальные риски от false positive,
|
|
фиксировать исключения и изменения правил.
|
|
- Проверять состояние учетных записей, срок действия паролей, лишние
|
|
административные доступы.
|
|
- Проверять стабильность VPN/удаленного доступа и отсутствие неожиданных
|
|
открытых портов.
|
|
- Готовить короткий отчет владельцу: что проверено, что исправлено, какие
|
|
риски остаются.
|
|
|
|
## Ежемесячные задачи
|
|
|
|
- Проводить контрольный тест восстановления из резервной копии на безопасном
|
|
участке данных или тестовой копии.
|
|
- Проверять обновления ОС и прикладного ПО, отдельно выделяя безопасные и
|
|
рискованные обновления.
|
|
- Планировать окно обслуживания для обновлений, перезагрузок и чистки.
|
|
- Проверять состояние сертификатов, доменных имен, VPN-профилей и учетных
|
|
данных удаленного доступа.
|
|
- Проводить аудит firewall-правил, пробросов портов и внешне доступных
|
|
сервисов.
|
|
- Проводить аудит web-сервера: виртуальные хосты, TLS-настройки, redirects,
|
|
reverse proxy, права на каталоги, logrotate, backup web-конфигурации и
|
|
отсутствие лишних публичных endpoints.
|
|
- Проводить аудит pfSense: WAN/LAN/VPN rules, NAT, aliases, floating rules,
|
|
DHCP/DNS settings, gateway groups и резервную копию конфигурации.
|
|
- Проводить аудит OpenVPN: server mode, client-specific overrides,
|
|
сертификаты, отозванные клиенты, push routes и доступы по пользователям.
|
|
- Проводить аудит Suricata: режим IDS/IPS, включенные rulesets, suppress list,
|
|
pass/drop правила и влияние на критичные сервисы.
|
|
- Проводить аудит Proxmox: версии, состояние repositories, backup schedule,
|
|
storage utilization, snapshots, права пользователей и доступ к web UI.
|
|
- Обновлять эксплуатационную документацию: IP-адреса, учетные записи без
|
|
паролей, роли серверов, схемы доступа, процедуры восстановления.
|
|
- Проверять, что нет устаревших или неизвестных сервисов, запущенных без
|
|
владельца и назначения.
|
|
|
|
## Инцидентные задачи
|
|
|
|
- Восстановление доступа к серверу, VM, web-серверу или прикладному сервису.
|
|
- Устранение нехватки места, памяти, зависших процессов и служб.
|
|
- Восстановление работы прикладных сервисов, файловых каталогов, баз данных
|
|
или сетевых шар.
|
|
- Разбор web-инцидентов: недоступность HTTP/HTTPS, ошибки TLS, неверный
|
|
redirect, поломка reverse proxy, массовые 4xx/5xx, переполнение логов или
|
|
нехватка места под web-контент.
|
|
- Разбор проблем VPN, маршрутизации, DNS, firewall и удаленного доступа.
|
|
- Разбор и восстановление pfSense после ошибки правил, NAT, gateway, DHCP,
|
|
DNS, interface/VLAN или некорректного firewall reload.
|
|
- Разбор и восстановление OpenVPN server/clients: TLS/auth ошибки, истекшие
|
|
сертификаты, невыданные маршруты, недоступность внутренних сетей.
|
|
- Разбор Suricata-инцидентов: ложная блокировка рабочего трафика, всплеск
|
|
алертов, обновление правил, отключение/исключение проблемной сигнатуры.
|
|
- Восстановление Proxmox VM/CT после зависания, нехватки storage, ошибки
|
|
backup/snapshot или некорректного shutdown.
|
|
- Восстановление после неудачного обновления, сбоя питания или некорректной
|
|
перезагрузки.
|
|
- Восстановление данных из резервной копии.
|
|
- Проверка подозрительной активности: неизвестные подключения, новые учетные
|
|
записи, неожиданные открытые порты, странные timers или cron jobs.
|
|
- Подготовка краткого инцидентного отчета: причина, влияние, что сделано, что
|
|
нужно изменить, чтобы сбой не повторился.
|
|
|
|
## Правила выполнения работ
|
|
|
|
- Перед рискованными изменениями делать резервную копию конфигурации или
|
|
snapshot, если это технически возможно.
|
|
- Перед изменениями pfSense/OpenVPN/Suricata сохранять текущий config backup и
|
|
фиксировать путь отката.
|
|
- Перед изменениями Proxmox делать snapshot/backup для затронутой VM/CT, если
|
|
это не ухудшает ситуацию и есть достаточно места.
|
|
- Не менять сетевые маршруты, firewall, VPN и удаленный доступ без понимания
|
|
пути отката.
|
|
- Не устанавливать обновления на production без оценки риска и окна
|
|
обслуживания.
|
|
- Не удалять старые данные и логи без проверки, что они не нужны для бизнеса
|
|
или расследования.
|
|
- После каждого изменения проверять фактический результат: доступность сервиса,
|
|
состояние VM, HTTP/HTTPS-ответ web-сервера, журнал ошибок, место на диске.
|
|
- Все изменения фиксировать: дата, сервер, действие, причина, результат,
|
|
способ отката.
|
|
|
|
## Минимальный SLA
|
|
|
|
- Плановая проверка: один раз в рабочий день.
|
|
- Реакция на полный простой ключевого сервиса: в течение 2-4 часов.
|
|
- Реакция на частичную деградацию: в течение рабочего дня.
|
|
- Еженедельный отчет владельцу.
|
|
- Плановые изменения только с резервной копией и проверкой результата.
|
|
- После каждого серьезного инцидента: краткий отчет и список мер против
|
|
повторения.
|
|
|
|
## Что не входит в этот объем
|
|
|
|
- Разработка и сопровождение AWatch-rus как продукта.
|
|
- Новые ActivityWatch-коллекторы и новые telemetry pipelines.
|
|
- Новые Grafana-дашборды и управленческая аналитика AWatch-rus.
|
|
- Новые аналитические контуры, созданные специально под AWatch-rus.
|
|
- Коммерческая упаковка, roadmap, CI/CD и разработка новых модулей AWatch-rus.
|
|
|
|
Эти работы нужно оформлять отдельным приложением к поддержке, когда владелец
|
|
готов заказывать сопровождение уже разработанной системы AWatch-rus.
|