Travel-индустрия не прощает простоев — каждая минута простоя может стоить бизнесу клиента. Как сделать так, чтобы большая инфраструктура работала 24/7 с минимальными простоями? В Туту мы пришли к мультиклауду не за один шаг.
Привет, Хабр! Меня зовут Андрей Борзов, я в Туту работаю с 2012 года — отвечаю за то, что… сайт работает. Мои команды занимаются железом, сетью, делают облака, занимаются отказоустойчивыми кластерами ВМ в облаках, а также готовят системы мониторинга.
В этом материале по мотивам выступления на конференции K2 Cloud Conf 2026 хочу рассказать об отказоустойчивости в мультиклауде — о том, как мы строим инфраструктуру Туту, зачем используем несколько облаков и собственные площадки и что происходит, когда что-то начинает ломаться.
Мы в Туту больше 20 лет работаем для того, чтобы путешественникам было легко решать свои задачи, и за этим стоит большая инфраструктура — есть 3000 микросервисов в нескольких кластерах kubernetes, монолит, а также сотни кластеров баз, очередей, кэшей и сопутствующих сервисов. Со всем этим зоопарком нужно обеспечить работу 24/7 с минимальными простоями. Простои наши клиенты не любят — у нас высококонкурентный бизнес, и если что-то не работает, клиент, как правило, сразу идет покупать билет или отель в другом месте. Поэтому наша цель — сделать так, чтобы при отказе любого из основных элементов инфраструктуры сайт продолжал работать. Теперь разберем, как это реализуется.