Отказоустойчивость: RTO, RPO и бэкапы

Отказоустойчивость: RTO, RPO и бэкапы

Отказоустойчивость — способность продолжать работу или восстановиться после сбоя. Сначала определите бизнес-процессы, зависимости и допустимые потери, затем выбирайте технологию.

RTO и RPO

RTO — целевое время восстановления после отказа. RPO — сколько данных можно потерять по времени. RPO в один час требует копий или репликации чаще часа; RTO в минуты требует готовой резервной среды, а не только архива. Это цели, а не обещание: проверяйте их тестом.

Правило бэкапов 3-2-1: три копии, два разных носителя, одна вне основной площадки. Добавьте offline или immutable-копию против ransomware, шифрование и контроль восстановления. Резервная копия, которую никто не пробовал восстановить, — предположение.

RAID и HA

RAID повышает доступность дисков, но не заменяет backup. RAID 1 зеркалирует, RAID 5/6 используют паритет, RAID 10 сочетает зеркала и чередование. Выбор зависит от нагрузки, времени восстановления и допустимого отказа; восстановление массива само создаёт нагрузку.

Высокая доступность использует резервные узлы, кластер, балансировщик и автоматическое переключение. Убирайте единые точки отказа: питание, сеть, DNS, хранилище и оператора. Географическое резервирование помогает при аварии площадки, но требует согласованности данных и плана DNS.

rsync -a --dry-run /srv/data/ /backup/data/

Dry-run показывает план без копирования; проверяйте права и журнал задания.

Проведите tabletop, затем технический тест: потеря узла, восстановление базы, доступ приложения и сверка RPO. Зафиксируйте фактический RTO, ошибки и владельцев действий. Учитывайте безопасность восстановленной среды: патчи, секреты, сетевые правила и журналирование должны быть актуальны.

Зависимости и тесты

RTO приложения бессмысленен, если DNS, IdP или лицензия восстанавливаются дольше. Нарисуйте цепочку зависимостей, назначьте альтернативы и договоритесь о ручном режиме. Для каждой копии проверьте доступность, целостность, шифрование и возможность восстановления без production-секретов.

HA не означает отсутствие потери данных: кластер может синхронно повторить ошибку или удалить запись на всех узлах. Нужны версии, snapshots и логическое восстановление. Автоматический failover тестируйте в окне изменений, фиксируя split-brain и порядок возврата.

После теста обновите runbook простыми шагами, контактами и командами. Документ должен быть пригоден для дежурного специалиста, который не проектировал систему.

Практическое задание

Закрепите тему на собственной тестовой схеме, не затрагивая рабочие системы. Сначала опишите активы и доверенные границы простыми словами, затем укажите владельца каждого решения. Для каждого риска запишите вероятность, последствия, существующий контроль и остаточный риск. Такой короткий реестр полезнее списка модных продуктов: он показывает, какую именно задачу решает мера и где остаётся пробел.

Проведите проверку в безопасной лаборатории и сохраните результат: время, команду или действие, ожидаемый результат и фактическое наблюдение. Если проверка не удалась, сначала проверьте разрешение, область теста и журналирование, а не усиливайте настройки вслепую. Любое исключение оформите с причиной, сроком и ответственным.

При разборе инцидента отделяйте факт от гипотезы. Факт подтверждается журналом, конфигурацией или воспроизводимым тестом; гипотеза требует дополнительной проверки. Это снижает риск неправильной атрибуции и помогает команде выбрать пропорциональную реакцию. После изменения контроля повторите тест и убедитесь, что доступность бизнеса не пострадала.

Полезный результат обучения — не запомнить термин, а уметь объяснить его на сценарии: какая угроза действует, какой актив затронут, какой контроль сработает первым, что обнаружит событие и как восстановиться. Именно такую цепочку проверяйте при подготовке к Security+.

Вопросы для самопроверки

Проверьте себя по сценарию. Какой актив защищается и какое свойство CIA важнее всего? Где проходит граница доверия? Как злоумышленник может получить первоначальный доступ, какое событие подтвердит гипотезу и кто принимает решение о сдерживании? Затем назовите как минимум один технический, один административный и один физический контроль. Для каждого укажите, является ли он превентивным, детективным или корректирующим, и какое доказательство эффективности можно получить.

Отдельно продумайте исключения. Что произойдёт, если основной сервис, каталог идентичностей или канал связи недоступен? Запишите ручную процедуру, резервный контакт и безопасный способ возврата к нормальной работе. Не забывайте о приватности: журналы должны содержать достаточно контекста для расследования, но не раскрывать пароли, токены и лишние персональные данные.

Хороший ответ Security+ связывает термин с решением и ограничением. MFA уменьшает риск украденного пароля, но не устраняет вредоносную конечную точку; резервная копия ускоряет восстановление, но не предотвращает утечку; IDS обнаруживает, но требует реакции. Такая причинно-следственная цепочка помогает выбирать правильный контроль в практическом вопросе. **Дисклеймер: материал учебный и не заменяет официальные exam objectives CompTIA.

Комментарии