Exploring Evaluation Techniques in Controlled Text Generation: A Comparative Study of Semantics and Sentiment in ruGPT3large-Generated and Human-Written Movie Reviews

Описание

Перевод названия: Оценка контролируемой генерации текста: сравнительное исследование семантики и сентимента в отзывах на фильмы, написанных ruGPT3large и человеком

Тип публикации: доклад, тезисы доклада, статья из сборника материалов конференций

Конференция: Диалог 2023; Москва; Москва

Год издания: 2023

Идентификатор DOI: 10.28995/2075-7182-2023-22-1082-1090

Ключевые слова: controlled text generation, strategy for quality measurement, topic modelling, sentiment-analysis, movie reviews, контролируемая генерация текста, стратегия измерения качества, тематическое моделирование, анализ тональности, отзывы на кино

Аннотация: The paper describes the proposed strategy for evaluation controlled text generation with the sentiment as attribute. Our approach mainly consists of automatic sentiment analysis (ruBERT) and topic modelling (BERTopic), which are applied to a parallel corpus with artificially produced and human-written texts. The model for evaluatioПоказать полностьюn is fine-tuned on the parsed reviews from big Russian movie-related website ruGPT3Large with the sentiment as prompt. The results of the analysis demonstrate that the proposed methods can offer a more comprehensive understanding of the advantages and limitations in the context of semantics and sentiment. Additionally, the paper employs metrics such as BERTscore and self-BLEU to further evaluate the generated text. The proposed methodology provides a novel approach for evaluating the quality of generated text and may have implications for future studies in the field. В статье предлагается новая стратегия оценки контролируемой генерации текста с тональностью в качестве атрибута. Наш подход включает автоматический анализ тональности (ruBERT) и тематическое моделирование (BERTopic). Эти инструменты применяются к параллельному корпусу, состоящему из пар “сгенерированный отзыв - реальный отзыв”. Модель используемая для оценки - ruGPT3Large, которая была ранее дообучена на собранных с Кинопоиска отзывах на фильмы с тональностью “вшитой” в затравку. Результаты анализа демонстрируют, что использованные методы предлагают более полное понимание преимуществ и ограничений в контексте семантики и эмоциональной окраски языковой модели. Кроме того, в статье применяются такие метрики, как BERTscore и self-BLEU, для дополнительной оценки сгенерированного текста. Наша методология представляет новый подход для оценки качества генерируемого текста и может дать основу для будущих исследований в этой области. Ключевые слова: контролируемая генерация текста, стратегия оценки качества, тематическое моделирование, сентимент-анализ, кинорецензии.

Ссылки на полный текст

Издание

Журнал: Computational Linguistics and Intellectual Technologies : Papers from the Annual International Conference

Выпуск журнала: Выпуск 22. Доп. том

Номера страниц: 1082-1090

Место издания: Москва

Издатель: Б. и.

Персоны

  • Margolina Anastasia (National Research University “Higher School of Economics”)
  • Kolmogorova Anastasia (National Research University “Higher School of Economics”)

Вхождение в базы данных