From 371a1e2728650810f41c3439baf7c0ced494556c Mon Sep 17 00:00:00 2001 From: igor04091968 Date: Wed, 17 Jun 2026 23:06:14 +0300 Subject: [PATCH] docs: narrow DetMir support scope --- docs/DETMIR_SUPPORT_TASKS_RU.md | 185 +++++++++++++++++--------------- 1 file changed, 101 insertions(+), 84 deletions(-) diff --git a/docs/DETMIR_SUPPORT_TASKS_RU.md b/docs/DETMIR_SUPPORT_TASKS_RU.md index eed959a..7948002 100644 --- a/docs/DETMIR_SUPPORT_TASKS_RU.md +++ b/docs/DETMIR_SUPPORT_TASKS_RU.md @@ -1,109 +1,126 @@ -# Задачи поддержки комплекса DetMir +# Задачи поддержки базового комплекса DetMir -Документ описывает регулярные и инцидентные работы, которые должны входить в -сопровождение производственного комплекса DetMir на базе AWatch-rus, -ActivityWatch, Windows/RDP-коллекторов, Grafana, ClickHouse, 1C-аналитики и -операторского gateway. +Документ описывает задачи сопровождения того комплекса серверов, +виртуализации, сетевых сервисов и прикладного ПО, который существовал до +начала разработки AWatch-rus. + +AWatch-rus, ActivityWatch-коллекторы, новые дашборды, новые контуры +телеметрии, ClickHouse-аналитика AWatch-rus и разработка продукта в этот +объем не входят. Их нужно оформлять отдельной следующей задачей. ## Цель поддержки -Поддержка должна обеспечивать не формальное состояние сервисов `active`, а -доказуемую работоспособность всего контура: свежие данные в bucket'ах, -корректные отчеты для владельца, рабочие дашборды, доступность gateway, -исправные Windows-задачи и отсутствие накопленных очередей. +Поддержка должна обеспечивать штатную работу базовой ИТ-инфраструктуры +DetMir: серверы доступны, виртуальные машины запущены, пользователи могут +работать через RDP и прикладное ПО, данные сохраняются, резервные копии +создаются, удаленный доступ контролируется, а аварии устраняются с понятной +фиксацией причины. + +## Состав поддерживаемого контура + +- Узел виртуализации и размещенные на нем виртуальные машины или контейнеры. +- Windows/RDP-серверы и пользовательские рабочие сессии. +- Существующие прикладные сервисы, включая 1C и связанные файловые каталоги. +- Существующие базы данных и служебные хранилища, если они уже использовались + до проекта AWatch-rus. +- Сетевой контур: маршрутизация, VPN, firewall, DNS, DHCP, удаленный доступ. +- Системные сервисы Linux/Windows, планировщики задач и фоновые службы. +- Резервное копирование, журналы, учетные записи и права доступа. ## Ежедневные задачи -- Проверять свежесть данных ActivityWatch: AFK, window, worktime sessions, - web category, DLP endpoint signals, file operations, email, collector guard. -- Проверять состояние RDP-хоста `SHARKON2025`: активные и отключенные сессии, - зависшие PowerShell-процессы, дубли `aw-watcher-*`, process storm. -- Проверять Windows-задачи и сервисы: - `AWatchRusCollectorGuard`, `ActivityWatch Recovery`, - `ActivityWatch Launch [...]`, `ActivityWatch File1C Upload`, - `ActivityWatch DLP Evidence Sync`, `ActivityWatch Hayabusa Upload`. -- Проверять доступность AW server, worktime API, Grafana, gateway, - 1C manager brief/actions/recovery. -- Проверять ClickHouse-контур: состояние Docker-контейнера, healthcheck, - сетевую доступность с AW-сервера, ingest timer, свежесть данных. -- Проверять ошибки в логах collector guard, browser collector, DLP, - file operations, File1C upload, DLP evidence sync и Hayabusa upload. -- Реагировать на `STALE`/`DEAD` bucket'ы точечно: перезапускать конкретный - collector, scheduled task или guard, а не выполнять массовые рестарты без - диагностики. -- Проверять, что owner-facing ссылки через gateway открываются штатно и не - требуют доступа к внутренним портам. +- Проверять доступность ключевых серверов и виртуальных машин. +- Проверять состояние узла виртуализации: нагрузка CPU/RAM, свободное место, + состояние storage, отсутствие зависших VM/CT. +- Проверять доступность RDP и возможность входа пользователей. +- Проверять состояние Windows-сервера: свободная память, диск, pagefile, + критические ошибки в журналах, зависшие процессы. +- Проверять работоспособность 1C и связанных сервисов: запуск, доступность, + отсутствие явных ошибок в журналах. +- Проверять сетевую связность между основными узлами, VPN и удаленный доступ. +- Проверять состояние firewall/NAT/маршрутов, если были жалобы на доступ. +- Проверять, что критичные systemd services, Windows services и scheduled tasks + находятся в ожидаемом состоянии. +- Проверять наличие свежих резервных копий по базовым системам. +- Фиксировать найденные проблемы и выполненные действия в журнале поддержки. ## Еженедельные задачи -- Готовить короткий отчет владельцу: что работало, что ломалось, какие периоды - данных неполные, что было исправлено. -- Проверять основные Grafana-дашборды и корректность отображения сотрудников. -- Контролировать отсутствие дублей пользователей в отчетах: `USER5/user5`, - машинные аккаунты, битая кодировка, неверная кириллица. -- Проверять накопление файлов в drop/inbox зонах Hayabusa, File1C и ClickHouse. -- Проверять свободное место, память, pagefile, Docker, nginx, systemd timers и - журналы ошибок на серверной стороне. -- Проверять, что scheduled tasks имеют ожидаемые интервалы запуска и последние - результаты без ошибок. -- Просматривать небольшие исправления и обновления, которые можно применить без - риска простоя. +- Проверять свободное место на всех важных дисках и хранилищах. +- Проверять накопление старых логов, временных файлов, дампов и архивов. +- Проверять успешность резервного копирования за неделю. +- Проверять, что резервные копии реально читаются и доступны для восстановления. +- Проверять системные журналы Linux/Windows на повторяющиеся ошибки. +- Проверять состояние учетных записей, срок действия паролей, лишние + административные доступы. +- Проверять стабильность VPN/удаленного доступа и отсутствие неожиданных + открытых портов. +- Готовить короткий отчет владельцу: что проверено, что исправлено, какие + риски остаются. ## Ежемесячные задачи -- Проверять резервные копии Grafana DB, ClickHouse-конфигов и данных, - ActivityWatch-конфигов, Windows deployment config, SSH-ключей и gateway - credentials. -- Проводить контрольное восстановление ключевых частей контура: AW server, - gateway, Grafana, ClickHouse ingest, Windows collectors. -- Выполнять аудит доступов: Basic Auth, SSH, WinRM, открытые порты, - сертификаты, firewall. -- Обновлять эксплуатационную документацию: IP-адреса, сервисы, task names, - owner-facing ссылки, команды восстановления. -- Проверять качество перед изменениями: Ansible syntax-check, PowerShell parse, - Rust tests/build для затронутых компонентов. +- Проводить контрольный тест восстановления из резервной копии на безопасном + участке данных или тестовой копии. +- Проверять обновления ОС и прикладного ПО, отдельно выделяя безопасные и + рискованные обновления. +- Планировать окно обслуживания для обновлений, перезагрузок и чистки. +- Проверять состояние сертификатов, доменных имен, VPN-профилей и учетных + данных удаленного доступа. +- Проводить аудит firewall-правил, пробросов портов и внешне доступных + сервисов. +- Обновлять эксплуатационную документацию: IP-адреса, учетные записи без + паролей, роли серверов, схемы доступа, процедуры восстановления. +- Проверять, что нет устаревших или неизвестных сервисов, запущенных без + владельца и назначения. ## Инцидентные задачи -- Восстанавливать сбор данных после остановки collector'ов или Windows-задач. -- Лечить зависшие RDP-сессии, stale watcher bucket'ы и дубли процессов. -- Перезапускать или пересоздавать конкретные Windows scheduled tasks. -- Устранять process storm, нехватку памяти и проблемы pagefile. -- Восстанавливать DLP endpoint signals и DLP evidence sync. -- Восстанавливать File1C upload, server ingest и ClickHouse health. -- Восстанавливать Hayabusa EVTX upload, drop processing и очереди intake. -- Исправлять Grafana-дашборды, gateway routes и права доступа. -- Проводить ручную валидацию после аварии: bucket freshness, отчеты, - gateway/Grafana HTTP-коды и отсутствие новых ошибок в логах. +- Восстановление доступа к серверу, VM, RDP или прикладному сервису. +- Устранение нехватки места, памяти, pagefile, зависших процессов и служб. +- Восстановление работы 1C, файловых каталогов, баз данных или сетевых шар. +- Разбор проблем VPN, маршрутизации, DNS, firewall и удаленного доступа. +- Восстановление после неудачного обновления, сбоя питания или некорректной + перезагрузки. +- Восстановление данных из резервной копии. +- Проверка подозрительной активности: неизвестные подключения, новые учетные + записи, неожиданные открытые порты, странные scheduled tasks. +- Подготовка краткого инцидентного отчета: причина, влияние, что сделано, что + нужно изменить, чтобы сбой не повторился. -## Изменения и развитие +## Правила выполнения работ -- Все изменения выполнять по схеме backup-first. -- Перед деплоем проверять синтаксис, тесты и применимость к текущему окружению. -- После деплоя проверять живые endpoints, timers, bucket freshness и - owner-facing дашборды. -- Не переписывать стабильные компоненты без причины; новые сервисные утилиты - делать автономными, systemd-friendly и с явными timeout'ами. -- Вести журнал изменений: что изменено, причина, дата, как проверить и как - откатить. +- Перед рискованными изменениями делать резервную копию конфигурации или + snapshot, если это технически возможно. +- Не менять сетевые маршруты, firewall, VPN и удаленный доступ без понимания + пути отката. +- Не устанавливать обновления на production без оценки риска и окна + обслуживания. +- Не удалять старые данные и логи без проверки, что они не нужны для бизнеса + или расследования. +- После каждого изменения проверять фактический результат: доступность сервиса, + вход пользователя, состояние VM, журнал ошибок, место на диске. +- Все изменения фиксировать: дата, сервер, действие, причина, результат, + способ отката. ## Минимальный SLA -- Плановый контроль: один раз в рабочий день. -- Реакция на критичный сбой сбора данных: в течение 2-4 часов. +- Плановая проверка: один раз в рабочий день. +- Реакция на полный простой ключевого сервиса: в течение 2-4 часов. +- Реакция на частичную деградацию: в течение рабочего дня. - Еженедельный отчет владельцу. - Плановые изменения только с резервной копией и проверкой результата. -- После каждого инцидента: краткое описание причины, выполненных действий и - мер против повторения. +- После каждого серьезного инцидента: краткий отчет и список мер против + повторения. -## Критерии приемки поддержки +## Что не входит в этот объем -- Все ключевые bucket'ы свежие или по каждому stale/dead bucket есть объяснение - и план восстановления. -- Владелец видит отчеты через защищенный gateway, без доступа к внутренним - техническим портам. -- Windows/RDP collector'ы работают в правильных пользовательских сессиях. -- ClickHouse, File1C, DLP и Hayabusa не имеют накопленных необработанных - очередей. -- Любое исправление подтверждается командой проверки, логом или HTTP-кодом, а - не только статусом systemd/Task Scheduler. +- Разработка и сопровождение AWatch-rus как продукта. +- Новые ActivityWatch-коллекторы и новые telemetry pipelines. +- Новые Grafana-дашборды и управленческая аналитика AWatch-rus. +- Новые ClickHouse/1C-аналитические контуры, созданные специально под + AWatch-rus. +- Коммерческая упаковка, roadmap, CI/CD и разработка новых модулей AWatch-rus. + +Эти работы нужно оформлять отдельным приложением к поддержке, когда владелец +готов заказывать сопровождение уже разработанной системы AWatch-rus.