U-BSS
Blog

Датасет для семантического анализа всего за несколько часов

30-yanvar, 20252 daqiqa o'qish

В новой версии NLU-suite, инструмента для обучения семантических и акустических моделей распознавания речи, добавлена функция взаимодействия с искусственным интеллектом. Теперь она позволяет решать основную практическую задачу — создавать обучающие датасеты на основе заданных классов. Решение было успешно протестировано в одном из банков Узбекистана с применением модели GPT-4o.

При обучении моделей ключевыми трудностями становятся сбор и подготовка примеров, а также классификация объектов. Как правило, для обучения семантических моделей используют метод Few-shot, при котором доступно ограниченное число обучающих примеров, либо метод Zero-shot, если тестового набора нет вообще.

Ранее для формирования обучающего набора инженеры по искусственному интеллекту либо сами создавали обучающие примеры, либо использовали LLM-модели, задавая им классы нужных объектов. Оба подхода требовали значительных затрат времени и труда со стороны разработчиков, так как необходимо было генерировать множество тестовых примеров, создание которых даже LLM-моделям давалось нелегко из-за сложности запросов. Кроме того, работа с LLM-моделями подразумевает передачу запроса внешнему сервису, что может быть неприемлемо для некоторых компаний с точки зрения информационной безопасности. В результате такой подход замедлял обучение и увеличивал сроки вывода модели в эксплуатацию.

Сейчас компания U-BSS предоставляет решение, которое использует LLM-модели для создания синтетических наборов данных. Этот подход позволяет применять преимущества Few-shot обучения и сокращать время, необходимое для подготовки данных, так как система генерирует примеры, оптимальные для обучения. Решение совместимо с разными LLM-моделями. Пользователь системы создает промпт или специализированный запрос, указывая параметры, важные для обучения диалоговой модели. Затем LLM-модель обрабатывает этот запрос и формирует разнообразный набор обучающих данных.

«Новый Инструмент NLU-suite значительно облегчает и ускоряет разработку моделей распознавания речи, исключая необходимость сбора обучающих данных. Пользователям достаточно составить запрос для LLM-модели, после чего нужные данные будут готовы всего за несколько часов. Эта возможность особенно полезна, когда компания выводит на рынок новый продукт или услугу и требуется оперативно реализовать соответствующий сценарий. Чтобы сгенерировать датасет, понадобится лишь краткое описание продукта или услуги, которое следует включить в промт. Благодаря этой функции нам удалось обучить модель LaBSE, которая теперь успешно используется», — отметил директор U-BSS Пулат Халиулин.