1. Инженерный анализ и ключевые критерии задачи
При обращении B2B-клиента в IT Standart (ул. Абиша Кекилбайулы 123, Алматы) мы не начинаем с коммерческого предложения, а с технического аудита текущего ландшафта. Симптомы, заставляющие бизнес искать аутсорсинг, стандартизированы: нестабильность Active Directory, «плавающие» права доступа, отсутствие инвентаризации парка, реактивное тушение пожаров вместо проактивного мониторинга, критический разрыв между RTO/RPO и реальными возможностями бэкапа. Наш инженерный анализ фокусируется на трех векторах: инфраструктурный, безопасностный и операционный.
Симптомы и триггеры перехода на аутсорсинг
- Инфраструктурный дрифт: Разнобой версий ОС (Windows Server 2012 R рядом с 2022), непатченные гипервизоры (ESXi / Hyper-V), отсутствие единого образа развертывания (Golden Image).
- Потеря контроля над идентичностью: Орфографические ошибки в OU-структуре, вложенные группы с циклическими ссылками, сервисные учетные записи с паролями «не менялись с 2018 года» и правами Domain Admin.
- Слепота мониторинга: Zabbix/Prometheus настроен только на «пинг» хостов, нет телеметрии по очередям дисков, репликации БД, состоянии Veeam/Veritas джобов.
- Shadow IT: Несанкционированные облачные синхронизации (OneDrive, Google Drive), локальные админы на рабочих станциях, неучтенные VPN-доступы подрядчиков.
Интерфейсы взаимодействия и архитектура решения
Архитектура аутсорсинга в IT Standart строится по модели Managed Service Provider (MSP) с жестким разделением зон ответственности. Ключевые интерфейсы интеграции:
- RMM-агент (Remote Monitoring & Management): Развертывание на 100% управляемых эндпоинтов и серверов. Обеспечивает инвентаризацию железа/софта, патч-менеджмент, выполнение скриптов от имени SYSTEM, сбор логов Windows Event Log / Syslog в единый SIEM.
- PSA-система (Professional Services Automation): Единая точка входа инцидентов (Service Desk). SLA-таймеры стартуют при создании тикета в портале или по почте
support@itstandart.kz. Интеграция с Telegram-ботом для L/L эскалации. - Бэкап-плоскость: Агент Veeam / Acronis Cyber Protect с централизованной консолью в нашем дата-центре (или выделенном сегменте клиента). Репозитории — Immutable storage (Object Lock) для защиты от ransomware.
- Network Access: Site-to-Site IPsec/IKEv туннели (MikroTik / FortiGate / Keenetic) к нашему NOC. Доступ инженейров только через PAM-шлюз (Privileged Access Management) с MFA и записью сессий (RDP/SSH).
Архитектура решения подразумевает «нулевое доверие» (Zero Trust) к внутренней сети клиента: никаких агентов без сертификатов, никаких RDP на белые IP, только исходящие соединения от клиента к нам.
2. Пошаговый профессиональный регламент выполнения
Регламент IT Standart соответствует ITIL 4 практикам: Incident, Problem, Change, Release, Service Level Management. Каждый этап имеет чек-листы и артефакты, подписываемые ведущим инженером.
Этап 0: Онбординг и Baseline Audit (Дни 1–5)
- Коллекция учетных данных: Передача через Bitwarden Send / 1Password Psst (срок жизни ссылки 24ч). Админки AD, гипервизоров, бэкапа, сетевого оборудования, панелей хостинга/облака.
- Развертывание RMM-агентов: Через GPO (Computer Startup Script) или PDQ Deploy / Ansible. Проверка heartbeat в консоли — > 99% онлайн за первый час.
- Инвентаризация (CMDB): Автосбор: CPU/RAM/Disk, OS Build, Installed Apps, Services, NIC config, BitLocker status, Last Patch Date. Ручная верификация критических серверов (1C, SQL, DC, File, Gateway).
- Аудит безопасности (Baseline): Скрипт
Invoke-ADHealthCheck(проверка KRBTGT, AdminSDHolder, Delegation, GPO, LAPS, Password Policy). Сканирование уязвимостей (OpenVAS / Nessus Essentials) внутренней сети. Отчет — PDF + Excel реестр рисков с CVSS. - Подписание SLA и Runbook: Согласование матрицы критичности (P–P), времени реакции (15 мин / 1 ч / 4 ч / 8 ч), окон обслуживания (Change Window: вт/чт 22:00–04:00).
Этап 1: Стабилизация и Hardening (Дни 6–20)
- Patch Management Baseline: Настройка WSUS / Windows Update for Business / Action. Принудительная установка Critical/Security обновлений за последние 12 месяцев на тестовой группе (5% парка), затем ролл-аут волнами. Ребут только в Change Window.
- Identity Hardening: Внедрение LAPS (Local Administrator Password Solution) на все воркстейшн/серверы. Перевод сервисных аккаунтов на gMSA (Group Managed Service Accounts). Блокировка NTLMv, принудительный Kerberos AES. Настройка Protected Users group для админов.
- Backup Validation: Тестовое восстановление (SureBackup / Instant Recovery) для каждого критического джоба. Проверка консистентности БД (DBCC CHECKDB для SQL, проверка репликации 1C). Настройка алертов на Veeam ONE: «No restore points for 24h», «Repository free space < 15%».
- Network Segmentation: Настройка VLAN/ACL: изоляция серверов БД, контроллеров домена, бэкап-репозиториев, рабочих станций. Запрет SMBv, LLMNR/NBT-NS отключение через GPO/Registry.
Этап 2: Переход в режим 24/7 Managed Services (День 21+)
- Мониторинг Golden Signals: Настройка дашбордов: Latency (ICMP/TCP), Traffic (NetFlow/sFlow), Errors (Interface Errors, TCP Retransmits), Saturation (CPU, RAM, Disk IOPS, Queue Length). Пороги: Warning 80%, Critical 90% в течение 10 мин.
- Log Aggregation & Correlation: Winlogbeat / Filebeat -> Logstash -> Elasticsearch. Правила детекта: EventID 4625 (Brute Force), 4720/4722/4724/4726 (Account Mgmt), 1102 (Audit Cleared), 7045 (Service Install), Sysmon EventID 1/3/7/10/11/13 (Process/Network/Driver/Image/Registry).
- Change Management Process: Любое изменение (патч, конфиг, скрипт) -> RFC в PSA -> Approval (CAB: Lead Engineer + Client Contact) -> Implementation -> Verification -> Close. Rollback-план обязателен для P/P изменений.
- Еженедельный/Ежемесячный отчет: Автогенерация через PowerBI / Grafana: Uptime SLA, Patch Compliance %, Backup Success Rate, Open/Closed Tickets Trend, Top 5 Alerts, Security Events Summary.
3. Технические параметры и эксплуатационные стандарты
Качество сервиса IT Standart измеримо. Мы не используем абстрактные «быстро» и «надежно», а оперируем техническими константами, зафиксированными в договоре и проверяемых аудитом.
Совместимость и матрица поддержки
- ОС Серверы: Windows Server 2016/2019/2022 (LTSC), Ubuntu 20.04/22.04/24.04 LTS, Rocky Linux 8/9, Astra Linux SE 1.7/2.12. Поддержка EOL-систем (2012 R, CentOS 7) только в режиме «Extended Support» с изоляцией в отдельном VLAN и компенсирующими мерами (IPS, виртуальное патчирование).
- Гипервизоры: VMware vSphere 7.0/8.0 (vCenter, ESXi), Hyper-V (Cluster/Standalone), Proxmox VE 7/8. Управление через API (PowerCLI, Ansible modules).
- БД и Приложения: MS SQL 2017/2019/2022 (AlwaysOn AG, FCI, Log Shipping), PostgreSQL 13–16 (Patroni/ETCD), 1C:Предприятие 8.3 (кластерный режим, публикация на IIS/Apache), Exchange 2016/2019 (Hybrid/On-prem).
- Сетевое оборудование: MikroTik (RouterOS 7.x), FortiGate (FortiOS 7.0+), Keenetic (OS 3.7+), HP Aruba / Cisco (CLI/SNMP). Конфигурации в Git-репозитории (NetBox + GitLab CI для пуша конфигов).
Надежность: HA, DR и RTO/RPO
Проектируем под Tier 2/3 требования (Uptime Institute):
- RTO (Recovery Time Objective): Критичные сервисы (1C, SQL, AD, VPN) — 1 час. Второстепенные (Файловый сервер, Print, WSUS) — 4 часа.
- RPO (Recovery Point Objective): БД (SQL/Postgres) — 15 минут (Log Backup / WAL Archiving). Файлы/VM — 1 час (Forever Forward Incremental). Архив — 24 часа.
- High Availability: AD — минимум 2 DC (PDC Emulator + RID Master на разных хостах/сайтах). SQL — AlwaysOn Availability Groups (Sync Commit, Automatic Failover). 1C — кластерная отказоустойчивость (cras + agents) на 2+ нодах. Гейты — VRRP/HSRP или FortiGate HA (Active-Passive).
- Disaster Recovery: Репликация критических VM в наш дата-центр (Veeam CDP / Zerto-like) с RPO < 5 мин. План DR тестируется раз в квартал (Failover Test без влияния на прод).
Стабильность и Performance Baselines
- Disk Latency: Avg. Disk sec/Read & Write < 10 мс (SSD/NVMe), < 50 мс (HDD/SAS). Queue Length < 2 на диск.
- Memory: Available MBytes > 15% от Total. Page File Usage < 50%. Нет Hard Faults/sec > 100 длительно.
- CPU: Processor Queue Length < 2 * Core Count. % Privileged Time < 30% (признак драйверов/IRQ).
- Network: