Сбер Molotilka (ML Toolkit for Continuous Learning)

Продукт
Разработчики: SberDevices (СалютДевайсы, ранее СберДевайсы)
Дата премьеры системы: 2022/11/24
Технологии: Речевые технологии

Основные статьи:

Molotilka — базовый инфраструктурный элемент «электронного мозга фирмы». Специализированные интернет-краулеры экосистем будущего будут днём и ночью сканировать бездонные просторы всемирной паутины, а мощные тензорные суперкомпьютеры будут постоянно дообучать фермы больших моделей машинного обучения, которые станут интеллектуальным ядром множества продуктов, инструментов и сервисов. При этом на продуктовом уровне возникнет не только возможность опираться на актуальную информацию и тренды, но также и изучать динамику информационного пространства для того, чтобы быстро принимать решения, влияющие на стратегию и тактику компаний на рынке.

2022: Анонс Molotilka (ML Toolkit for Continuous Learning)

Компания SberDevices представила 24 ноября 2022 года инструмент Molotilka (ML Toolkit for Continuous Learning) для работы с пайплайнами больших языковых моделей. В нем реализована автоматизация постоянного дообучения с минимальным забыванием старых знаний. Сервис для использования постоянно дообучаемых при помощи Molotilka больших нейросетевых моделей доступен в Cloud ML Space — платформе для ML-разработки полного цикла.

Иллюстрация:itproger.com

Поток знаний непрерывен, каждый день происходит множество событий. При обучении большой нейросетевой языковой модели обычно используется срез данных, доступных в интернете или других источниках. Таким образом, модель не будет обладать знаниями о том, что произошло в 2022 году, если обучили ее в 2021 году. Для этого была создана Molotilka, которая обладает актуальными знаниями в каждый момент времени и при этом помнит и старые знания.

В первой версии фреймворка была использована языковая модель ruGPT-3, которую команда SberDevices обучила ранее на большом корпусе текстов из различных источников: книги, интернет и т.д. На основе скаченных данных из нескольких новостных источников регулярно формировался небольшой датасет, в который добавлялось немного случайных данных из большого датасета так, чтобы соотношение старых и новых данных соответствовало заданной пропорции. После чего ruGPT-3 дообучалась на смешанном наборе данных с применением актуальных методов борьбы с катастрофическим забыванием. В ходе этого эксперимента применялись разные подходы, и в результате был выбран вариант на основе adapters — с добавлением специальных слоев и их последующим дообучением.Как защищать «поумневшие» промышленные сети: «Синоникс» на страже безопасного объединения изолированных сетей 6.1 т

Так появился инструмент, названный Molotilka, который позволяет проводить непрерывное обучение языковых моделей с повторением некоторых заранее заданных действий. Например, таких как скачивание актуальных данных из новостных источников, их предобработка, создание датасета для дообучения языковой модели и ее оценка на разных задачах.

ML Toolkit for Continuous Learning может применяться в таких областях:

  • стандартное применение ruGPT-3 как языковой модели, обладающей актуальными знаниями о мире;
  • задание кастомизированных задач с постоянным дообучением модели на новых данных: классификация, извлечение информации, диалоговые системы и пр.

Теперь при помощи специального сервиса пользователи Cloud ML Space получили через API доступ к наиболее актуальной версии ruGPT-3, которая всегда в курсе свежих новостей, трендов и мемов, а также к предыдущим версиям модели. Пример использований API размещён в открытом доступе. К числу постоянно дообучаемых моделей добавятся и другие нейросети Сбера.



Подрядчики-лидеры по количеству проектов

За всю историю
2021 год
2022 год
2023 год
Текущий год

  Группа компаний ЦРТ (Центр речевых технологий) (43)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (27)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (25)
  Naumen (Наумен консалтинг) (14)
  Voice Systems Robotics (VSR, VS Robotics) (9)
  Другие (149)

  Группа компаний ЦРТ (Центр речевых технологий) (5)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (4)
  Naumen (Наумен консалтинг) (2)
  Neuro.net (Нейро) (2)
  Voice Systems Robotics (VSR, VS Robotics) (2)
  Другие (15)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (12)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (7)
  Naumen (Наумен консалтинг) (3)
  Voice Systems Robotics (VSR, VS Robotics) (3)
  Мегапьютер Интелидженс (Megaputer Intelligence) (2)
  Другие (11)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (9)
  Группа компаний ЦРТ (Центр речевых технологий) (8)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (6)
  Naumen (Наумен консалтинг) (4)
  Unlimited Production (Анлимитед Продакшен) (4)
  Другие (18)

  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (3)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2)
  Napoleon IT (Наполеон Айти) (1)
  Naumen (Наумен консалтинг) (1)
  Voice Systems Robotics (VSR, VS Robotics) (1)
  Другие (8)

Распределение вендоров по количеству проектов внедрений (систем, проектов) с учётом партнёров

За всю историю
2021 год
2022 год
2023 год
Текущий год

  Группа компаний ЦРТ (Центр речевых технологий) (16, 46)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (3, 28)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (11, 27)
  Яндекс (Yandex) (9, 15)
  Avaya (4, 13)
  Другие (300, 145)

  Группа компаний ЦРТ (Центр речевых технологий) (2, 5)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (1, 5)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
  Naumen (Наумен консалтинг) (1, 2)
  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 2)
  Другие (7, 9)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2, 12)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
  Naumen (Наумен консалтинг) (1, 3)
  Voice Systems Robotics (VSR, VS Robotics) (1, 3)
  Voximplant (Фастком) (2, 2)
  Другие (9, 11)

  МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 9)
  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 8)
  Группа компаний ЦРТ (Центр речевых технологий) (4, 7)
  Unlimited Production (Анлимитед Продакшен) (1, 6)
  Naumen (Наумен консалтинг) (2, 4)
  Другие (12, 13)

  Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 4)
  SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
  Ростелеком (1, 2)
  Яндекс (Yandex) (1, 2)
  Naumen (Наумен консалтинг) (1, 1)
  Другие (6, 6)

Распределение систем по количеству проектов, не включая партнерские решения

За всю историю
2021 год
2022 год
2023 год
Текущий год

  МТТ VoiceBox - 24
  BSS Digital2Speech - 20
  Voice2Med Система распознавания речи в медицине - 14
  SmartLogger II - 12
  Naumen Erudite - 12
  Другие 161

  BSS Digital2Speech - 5
  Voice2Med Система распознавания речи в медицине - 4
  3i TouchPoint Analytics - 2
  Naumen Erudite - 2
  МТТ VoiceBox - 2
  Другие 9

  МТТ VoiceBox - 11
  BSS Digital2Speech - 6
  VS Robotics: VS Робот-оператор - 3
  Naumen Erudite - 3
  VoxImplant - 2
  Другие 12

  МТТ VoiceBox - 9
  BSS Digital2Speech - 7
  EXpress Защищенный корпоративный мессенджер - 6
  SmartLogger II - 4
  Naumen Erudite - 3
  Другие 17

  BSS Digital2Speech - 2
  BSS: Виртуальный голосовой ассистент - 2
  YandexGPT (YaLM 2.0) - 2
  NLab Speech TTS - 1
  СберБизнесБот - 1
  Другие 7