1 of 34

Структурированный анализ тональности в русскоязычных текстах

Автор: Россяйкин Петр Олегович� Научный консультант: Ивченко Александр Владимирович

Курс: «Нейронные сети и их применение в научных исследованиях»

2 of 34

Structured sentiment analysis (SSA)

Структурированный анализ тональности в русскоязычных текстах

Извлечение кортежей мнений вида:

(источник, цель, выражение, полярность)

3 of 34

Структурированный анализ тональности в русскоязычных текстах

Данные: пример

4 of 34

Структурированный анализ тональности в русскоязычных текстах

Данные

Данные соревнования RuOpinionNE-2024

train: 2556 текстов

validation: 1316 текстов

train:

2471 + 85 текстов (1 предложение / 2+ предложения)

2904 кортежей

https://github.com/dialogue-evaluation/RuOpinionNE-2024

5 of 34

Структурированный анализ тональности в русскоязычных текстах

Данные: анализ

  • 1062 текста без кортежей
  • 769 с 1 кортежем
  • 725 с 2+ кортежами (максимально: 14, 23)

6 of 34

Структурированный анализ тональности в русскоязычных текстах

Данные: sources

7 of 34

Структурированный анализ тональности в русскоязычных текстах

Длины текстов в токенах

MPQA: 23,3

DS: 20

this: 18,1

OpNES: 17,4

NoReC: 16,9

MBCA: 15,2

OpNEN: 14,8

MBEU: 10,6

8 of 34

Структурированный анализ тональности в русскоязычных текстах

Данные: длины выражений

source

target

expression

NoReC

1,0

2,0

5,0 (1)

MBCA

1,1 (3)

2,4 (2)

2,6 (2)

this

1,4 (2)

1,5

2,6 (3)

OpNEN

1,0

1,8

2,4

OpNES

1,0

2,2 (3)

2,2

MBEU

1,1 (3)

1,4

2,2

MPQA

2,7 (1)

6,3 (1)

2,0

9 of 34

Структурированный анализ тональности в русскоязычных текстах

Методы

  1. seq2seq (порождение кортежей через LLM)
    1. few-shot prompting
    2. fine tuning
  2. graph (предсказание связей между токенами)

10 of 34

Структурированный анализ тональности в русскоязычных текстах

few-shot prompting: вариант 1

11 of 34

Структурированный анализ тональности в русскоязычных текстах

Вариант 1: затравка

12 of 34

Структурированный анализ тональности в русскоязычных текстах

Few-shot prompting: вариант 2

13 of 34

Структурированный анализ тональности в русскоязычных текстах

Вариант 2: затравка

14 of 34

Структурированный анализ тональности в русскоязычных текстах

Вариант 1: инструктивные модели

F1

IlyaGusev / saiga_llama3_8b 0,13

lightblue / suzume-llama-3-8B-multilingual 0,114

lightblue / suzume-llama-3-8B-multilingual-orpo-borda-half 0,104

Yandex / YandexGPT 0,087

Vikhrmodels / it-5.4-fp16-orpo-v2 0,041

Vikhrmodels / Vikhr-7B-instruct_0.4 0,032

7-13 примеров; температура: 0,2-0,5; top_p: 0,95

15 of 34

Структурированный анализ тональности в русскоязычных текстах

Вариант 1+2: очень большие LM

1 2

Mistral Large 2 (mistral-large-latest) 0,272 0,281

Claude 3.5 Sonnet (claude-3.5-sonnet) 0,261

gpt-4o (gpt-4o-2024-08-06) 0,25 0,275

Grok-2 (grok-beta) 0,245

competition baseline 0,17

Saiga Llama 3 8B (saiga_llama3_8b) 0,114

15 примеров; температура: 0,5; top_p: 0,9

16 of 34

Графовый подход

Структурированный анализ тональности в русскоязычных текстах

17 of 34

[CLS] Бриджит Бардо угрожает переездом в Россию, шантажируя Францию слонихами

(4 класса ребер + none)

Структурированный анализ тональности в русскоязычных текстах

18 of 34

Бинарное представление данных

Структурированный анализ тональности в русскоязычных текстах

19 of 34

Структурированный анализ тональности в русскоязычных текстах

20 of 34

Структурированный анализ тональности в русскоязычных текстах

2 матрицы вместо 5

21 of 34

Структурированный анализ тональности в русскоязычных текстах

Архитектура

22 of 34

Структурированный анализ тональности в русскоязычных текстах

Вариант модели

23 of 34

Структурированный анализ тональности в русскоязычных текстах

Аугментации

  1. Перевод с помощью Google Translate: 3831 объект
    1. MultiBookedCA (каталанский)
    2. MultiBookedEU (баскский)
    3. OpeNEREN (английский)
    4. OpeNERES (испанский)
  2. Порождение кортежей на основе корпуса Gazeta: 3000 объектов
    • только предложения от 5 до 50 слов
    • модели Mistral Large 2 (1500) + Grok-2 (1500)

24 of 34

Структурированный анализ тональности в русскоязычных текстах

4 этапа обучения

  1. Основной датасет (15 эпох)
  2. Переводные данные (15 эпох)
  3. Сгенерированные данные (15 эпох)
  4. Основной датасет (10/15 эпох; +/- разморозка)

25 of 34

Структурированный анализ тональности в русскоязычных текстах

BCEloss (валидация)

26 of 34

Структурированный анализ тональности в русскоязычных текстах

MSE (валидация)

27 of 34

Структурированный анализ тональности в русскоязычных текстах

Binary acc (валидация)

28 of 34

Структурированный анализ тональности в русскоязычных текстах

Метрика: Sentiment Tuple F1

29 of 34

Структурированный анализ тональности в русскоязычных текстах

Sentiment Tuple F1

OpeNEREN 76,3 (Barnes et al. 2022: 1284)

MultiBookedEU 73,9

OpeNERES 73,5

MultiBookedCA 72,8

NoReC 52,9

DS 49,4

MPQA 44,7 (новости)

this 28,1 (новости)

30 of 34

Структурированный анализ тональности в русскоязычных текстах

Анализ ошибок

31 of 34

Структурированный анализ тональности в русскоязычных текстах

  • Значение метрики 0,281
  • Достигнуто с помощью LLM
  • Выше официального бэйзлайна соревнования, ниже качества на других датасетах
  • Невысокое качество связано с особенностями датасета
  • (Разработанный вариант графового подхода себя не оправдывает)

Результаты

32 of 34

Структурированный анализ тональности в русскоязычных текстах

План

Графовый подход:

  • Многоклассовая классификация
  • Эксперименты с архитектурой
  • Еще больше аугментаций
  • Графовые сети

Seq2seq-подход: fine-tuning

33 of 34

Структурированный анализ тональности в русскоязычных текстах

  • Сборник «Компьютерная лингвистика и интеллектуальные технологии» (по материалам конференции Dialogue 2025)
  • Сборник материалов конференции AINL
  • Сборник материалов конференции Annual Meeting of the Association for Computational Linguistics

Журналы

34 of 34

Структурированный анализ тональности в русскоязычных текстах

Заключение

  • Новый подход к представлению графовых данных
  • Бинарная классификация 2 карт признаков�= предсказание ребер графа
  • Значительно меньше параметров, чем при использовании LLM
  • На данный момент приемлемого качества нет, но есть способы улучшения

  • seq2seq-подход дает приемлемое качество даже без дообучения
  • (но инференс стоит дорого)