# Задачи поддержки базового комплекса DetMir Документ описывает задачи сопровождения того комплекса серверов, виртуализации, сетевых сервисов и прикладного ПО, который существовал до начала разработки AWatch-rus. AWatch-rus, ActivityWatch-коллекторы, новые дашборды, новые контуры телеметрии, ClickHouse-аналитика AWatch-rus и разработка продукта в этот объем не входят. Их нужно оформлять отдельной следующей задачей. ## Цель поддержки Поддержка должна обеспечивать штатную работу базовой ИТ-инфраструктуры DetMir: серверы доступны, виртуальные машины запущены, пользователи могут работать через RDP и прикладное ПО, данные сохраняются, резервные копии создаются, удаленный доступ контролируется, а аварии устраняются с понятной фиксацией причины. ## Состав поддерживаемого контура - Узел виртуализации и размещенные на нем виртуальные машины или контейнеры. - Windows/RDP-серверы и пользовательские рабочие сессии. - Существующие прикладные сервисы и связанные файловые каталоги. - Существующие базы данных и служебные хранилища, если они уже использовались до проекта AWatch-rus. - Proxmox: состояние узла, VM/CT, storage, snapshots, backups, web-доступ. - pfSense: firewall, NAT, маршрутизация, VLAN/interface status, DHCP, DNS, gateway monitoring, логи и правила доступа. - OpenVPN: сервер, клиентские профили, сертификаты, маршруты, доступность подключений и контроль истекающих ключей. - Suricata: состояние IDS/IPS, обновление правил, алерты, false positive, исключения и влияние блокировок на рабочий трафик. - Сетевой контур: маршрутизация, VPN, firewall, DNS, DHCP, удаленный доступ. - Системные сервисы Linux/Windows, планировщики задач и фоновые службы. - Резервное копирование, журналы, учетные записи и права доступа. ## Ежедневные задачи - Проверять доступность ключевых серверов и виртуальных машин. - Проверять состояние узла виртуализации: нагрузка CPU/RAM, свободное место, состояние storage, отсутствие зависших VM/CT. - Проверять Proxmox: состояние node, VM/CT, storage, backup jobs, snapshots и ошибки в task log. - Проверять доступность RDP и возможность входа пользователей. - Проверять состояние Windows-сервера: свободная память, диск, pagefile, критические ошибки в журналах, зависшие процессы. - Проверять работоспособность прикладных сервисов: запуск, доступность, отсутствие явных ошибок в журналах. - Проверять сетевую связность между основными узлами, VPN и удаленный доступ. - Проверять состояние firewall/NAT/маршрутов, если были жалобы на доступ. - Проверять pfSense: gateway status, interface status, DHCP leases, firewall/NAT rules, логи блокировок по жалобам на доступ. - Проверять OpenVPN server и клиентов: активные подключения, маршруты, reachability внутренних сетей, ошибки TLS/auth/route push. - Проверять Suricata: запущен ли сервис, нет ли массовых блокировок рабочего трафика, критичных алертов и переполнения логов. - Проверять, что критичные systemd services, Windows services и scheduled tasks находятся в ожидаемом состоянии. - Проверять наличие свежих резервных копий по базовым системам. - Фиксировать найденные проблемы и выполненные действия в журнале поддержки. ## Еженедельные задачи - Проверять свободное место на всех важных дисках и хранилищах. - Проверять накопление старых логов, временных файлов, дампов и архивов. - Проверять успешность резервного копирования за неделю. - Проверять, что резервные копии реально читаются и доступны для восстановления. - Проверять системные журналы Linux/Windows на повторяющиеся ошибки. - Проверять pfSense и сетевые журналы: повторяющиеся блокировки, падение gateway, flapping интерфейсов, ошибки DNS/DHCP/VPN. - Проверять OpenVPN: список активных клиентов, неиспользуемые профили, приближающиеся к истечению сертификаты, корректность клиентских маршрутов. - Проверять Suricata alerts: отделять реальные риски от false positive, фиксировать исключения и изменения правил. - Проверять состояние учетных записей, срок действия паролей, лишние административные доступы. - Проверять стабильность VPN/удаленного доступа и отсутствие неожиданных открытых портов. - Готовить короткий отчет владельцу: что проверено, что исправлено, какие риски остаются. ## Ежемесячные задачи - Проводить контрольный тест восстановления из резервной копии на безопасном участке данных или тестовой копии. - Проверять обновления ОС и прикладного ПО, отдельно выделяя безопасные и рискованные обновления. - Планировать окно обслуживания для обновлений, перезагрузок и чистки. - Проверять состояние сертификатов, доменных имен, VPN-профилей и учетных данных удаленного доступа. - Проводить аудит firewall-правил, пробросов портов и внешне доступных сервисов. - Проводить аудит pfSense: WAN/LAN/VPN rules, NAT, aliases, floating rules, DHCP/DNS settings, gateway groups и резервную копию конфигурации. - Проводить аудит OpenVPN: server mode, client-specific overrides, сертификаты, отозванные клиенты, push routes и доступы по пользователям. - Проводить аудит Suricata: режим IDS/IPS, включенные rulesets, suppress list, pass/drop правила и влияние на критичные сервисы. - Проводить аудит Proxmox: версии, состояние repositories, backup schedule, storage utilization, snapshots, права пользователей и доступ к web UI. - Обновлять эксплуатационную документацию: IP-адреса, учетные записи без паролей, роли серверов, схемы доступа, процедуры восстановления. - Проверять, что нет устаревших или неизвестных сервисов, запущенных без владельца и назначения. ## Инцидентные задачи - Восстановление доступа к серверу, VM, RDP или прикладному сервису. - Устранение нехватки места, памяти, pagefile, зависших процессов и служб. - Восстановление работы прикладных сервисов, файловых каталогов, баз данных или сетевых шар. - Разбор проблем VPN, маршрутизации, DNS, firewall и удаленного доступа. - Разбор и восстановление pfSense после ошибки правил, NAT, gateway, DHCP, DNS, interface/VLAN или некорректного firewall reload. - Разбор и восстановление OpenVPN server/clients: TLS/auth ошибки, истекшие сертификаты, невыданные маршруты, недоступность внутренних сетей. - Разбор Suricata-инцидентов: ложная блокировка рабочего трафика, всплеск алертов, обновление правил, отключение/исключение проблемной сигнатуры. - Восстановление Proxmox VM/CT после зависания, нехватки storage, ошибки backup/snapshot или некорректного shutdown. - Восстановление после неудачного обновления, сбоя питания или некорректной перезагрузки. - Восстановление данных из резервной копии. - Проверка подозрительной активности: неизвестные подключения, новые учетные записи, неожиданные открытые порты, странные scheduled tasks. - Подготовка краткого инцидентного отчета: причина, влияние, что сделано, что нужно изменить, чтобы сбой не повторился. ## Правила выполнения работ - Перед рискованными изменениями делать резервную копию конфигурации или snapshot, если это технически возможно. - Перед изменениями pfSense/OpenVPN/Suricata сохранять текущий config backup и фиксировать путь отката. - Перед изменениями Proxmox делать snapshot/backup для затронутой VM/CT, если это не ухудшает ситуацию и есть достаточно места. - Не менять сетевые маршруты, firewall, VPN и удаленный доступ без понимания пути отката. - Не устанавливать обновления на production без оценки риска и окна обслуживания. - Не удалять старые данные и логи без проверки, что они не нужны для бизнеса или расследования. - После каждого изменения проверять фактический результат: доступность сервиса, вход пользователя, состояние VM, журнал ошибок, место на диске. - Все изменения фиксировать: дата, сервер, действие, причина, результат, способ отката. ## Минимальный SLA - Плановая проверка: один раз в рабочий день. - Реакция на полный простой ключевого сервиса: в течение 2-4 часов. - Реакция на частичную деградацию: в течение рабочего дня. - Еженедельный отчет владельцу. - Плановые изменения только с резервной копией и проверкой результата. - После каждого серьезного инцидента: краткий отчет и список мер против повторения. ## Что не входит в этот объем - Разработка и сопровождение AWatch-rus как продукта. - Новые ActivityWatch-коллекторы и новые telemetry pipelines. - Новые Grafana-дашборды и управленческая аналитика AWatch-rus. - Новые аналитические контуры, созданные специально под AWatch-rus. - Коммерческая упаковка, roadmap, CI/CD и разработка новых модулей AWatch-rus. Эти работы нужно оформлять отдельным приложением к поддержке, когда владелец готов заказывать сопровождение уже разработанной системы AWatch-rus.