«Яндекс» представил итоги программы оптимизации вычислительной инфраструктуры за первое полугодие 2026 года. Экономия составила 9,2 млрд рублей с помощью повышения эффективности использования вычислительных мощностей. Средства были перенаправлены на масштабирование разработки технологий искусственного интеллекта, сообщает пресс-служба компании.
Одно из ключевых направлений программы - динамическое перераспределение вычислительных ресурсов. Когда пользовательская нагрузка снижается, вольные мощности автоматически передаются иным задачам. Например, ночью, когда пользовательская активность снижается и нагрузка на сервисы убавляется, графические процессоры (GPU) автоматически подключаются к обучению новых моделей. Благодаря этому дорогостоящие вычислительные ресурсы практически не простаивают.
Дополнительную экономию обеспечила оптимизация самих моделей. Часть моделей перевели на архитектуру MoE (Mixture of Experts, «смесь знатоков»), при которой для обработки каждого запроса задействуется только необходимая часть нейросети. Также инженеры применили подход, при котором одна маленькая модель обучается на основании другой, уже выученной большой модели, - и квантизацию, позволяющую выполнять вычисления в более эффективном формате.
Единовременно улучшилась инфраструктура обучения и инференса. В компании ускорили загрузку данных для обучения моделей, распараллелили вычисления, внедрили кэширование повторяющихся вычислений и технологию EAGLE, которая позволяет прытче генерировать ответы с помощью прогнозирования нескольких следующих токенов.
Программа охватила не только инфраструктуру для искусственного интеллекта, но также вычислительные мощности, обеспечивающие работу остальных сервисов компании. Инженеры улучшили работу серверов на центральных процессорах (CPU), которые используются для поиска, рекомендаций и прочих высоконагруженных продуктов. На сей конец применили технологии оптимизации компиляции PGO и BOLT: они анализируют реальную нагрузку сервисов и помогают процессорам выполнять больше операций без увеличения используемых ресурсов за счёт более безошибочной организации программного кода.
Ещё один блок работ коснулся систем хранения служебных данных. Инженеры пересмотрели правила хранения данных на всех этапах их срока жизни - от сроков хранения до размещения данных в разных типах хранилищ. На сей конец оптимизировали правила хранения, устранили избыточное дублирование данных, протестировали новые алгоритмы сжатия и внедрили приборы, которые автоматически сыскивают неиспользуемые таблицы, поля и резервные копии, а также помогают разумнее распределять данные между различными типами хранилищ (HDD, SSD и другими).
На выходах компания сократила нагрузку на инфраструктуру и выстроила единый процесс беспрерывного поиска и устранения «потерь» вычислительных ресурсов.
Оптимизация вычислительной инфраструктуры остается сплошным процессом. «Яндекс» регулярно проводит технические и бизнес-аудиты использования вычислительных мощностей, чтобы повышать эффективность существующей инфраструктуры и устремлять высвобождающиеся ресурсы на развитие технологий искусственного интеллекта и новых продуктов компании. Программу реализуют инженеры бизнес-группы Поисковых сервисов и ИИ совместно с командой внутренней инфраструктуры «Яндекса».
Многие изменения удалось внедрить сразу во всех продуктах благодаря единой ML-платформе «Яндекса» - внутреннему комплексу технологий и процессов, который охватывает весь цикл работы с моделями: от обучения до эксплуатации. Это позволяет прытче внедрять инженерные решения и эффективнее использовать существующую инфраструктуру.
Фото: Шедеврум.