Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

В этом ноутбуке представлена реализация задачи тематического моделирования. Моделирование проводилось с помощью факторного анализа (PCA) для 3 датасетов, которые были получены с помощью парсинга различных сайтов по ключевым словам "компьютер", "продажа". Предполагается, что эти тексты имеют отношение к продаже техники и компьютеров.

Последовательность решения задачи такая:

  1. Предобработка текстов (удаление стоп-слов, лемматизация и т.д)
  2. Удаление дублирующихся текстов, репостов и очень похожих сообщений
  3. Создание эмбеддингов текстов, добавление в FAISS
  4. Извлечение из FAISS текстов, самых релевантных запросу
  5. Создание TF-IDF эмбеддингов
  6. Проведение PCA
  7. Отбор самых релевантных для каждого фактора сообщений
  8. Определение темы набора сообщений (для каждого фактора)

В самом последнем блоке "Объединенный датасет" демонстрируется устойчивость разработанного решения - 3 датасета, которые анализировались по отдельности, объединяются в один.

При этом темы, которые были выделены в маленьких датасетах, также должны быть найдены и в большом датасете, что и получилось :)

About

This project implements topic modeling using factor analysis to extract underlying topics from text data

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages