Аналіз біомаси
Є майже 800 відео де русня на камеру говорить що підтримує геноцид українців і свого царя пиню, підтримує окупантів, які вбивають українців і так далі.
Мені стало цікаво хто ж пише їм тексти, тому що вони кажуть майже одне й те саме, але там матеріалу на більш ніж 10 годин пропаганди, слухати яку взагалі не хочеться. Тому давайте проаналізуємо та виділимо основне з цієї стіни тексту лайна.
Для цього будемо використовувати WordCloud для Python.
from wordcloud import WordCloud,STOPWORDS
import pandas as pd
import matplotlib.pyplot as plt
data = pd.read_csv("biomasa.csv")
data.head()
Але де взяти текстовий варіант тої херні яку вони говорять? Для цього використаємо безкоштовний сервіс від OpenAI, який називається Whisper (про нього я писав тут). Він дозволяє перетворювати слова з відео в текст. Підтримує багато мов, працює на відеокарті через натреновану модель нейромережі.
Чекаємо 2 – 3 години та отримуємо текст довжиною ~426000 символів, або ~64000 слів,
Який тепер треба запихнути в програму для Python, котра покаже, які слова ця русня використовує найчастіше та побудує гарненьку хмарку найпопулярніших слів.
Ось ці слова русня говорить найчастіше в своїх 800 відео в підтримку геноциду українців.
До речі, коли програма згенерувала перше зображення, то я зовсім забув про стоп слова — це такі треш слова, які люди (в нашому випадку свині) використовують найчастіше: прийменники в, на, і т.д, а також інші типу мы, ещё, без, же, да, под та інші.
Згенероване зображення без цих стоп слів наче намагається щось сказати:
Тож, ми маємо список найпопулярніших слів, тепер давайте спробуємо з них нагенерувати через ChatGPT якийсь текст, використовуючи тільки ці найпопулярніші ключові слова. Я не буду використовувати всі, а тільки ті, які вони вживають найчастіше:
Спробуємо дізнатись, чи може ChatGPT допомогти русні висловити свої слова підтримки окупантам та їхньому диктатору.
Отже, я можу з впевненістю стверджувати, що тексти їм пише нейромережа.
***
Для тих, хто хоче побачити всі ті 800 відео, я їх зібрав в одне та залив сюди:
(посилання буде доступне приблизно до 04.11.23)
Текстова версія: https://idiod.video/f0hr3p.txt
Дублікати відео перевірялись та видалялись через czkawka
Останні скріни це звісно не генерація, а копіпаст.
@lemmy це саме генерація, https://idiod.video/xf4qxg.mp4 я сам шокований був як він тільки по якимось випадковим словам може генерувати те, що вони співають своїм поганим ротом
Нічосі ти Data Analytics
Була у мене книжка, але не пам’ятаю чия. Український письменник, що входив до Спілки Письменників України, чи то його вигнали звідти, от не пам’ятаю зовсім. Вся книга була просякнута сатиричним висміюванням радянської політики стосовно письменництва, навіть наведена покрокова інструкція для написання промов перед партійними діячами.
До чого все це — цілком можливо русня користується саме такою методикою, її спускають на телебачення, а звідти воно ллється в нєокрєпшие мозгі. Але і твоє припущення про нейромережу теж має право на життя.
p.s. шкода, книжку загубив(
@sumni3bochennia Можливо так і є, для цього треба повторити аналіз, але вже з телепропагандою.
@peaceduck рашистської пропаганди в 100 разів більше, вони ж її по всім каналам крутять, фізично все це зберегти нереально, а тим паче проаналізувати, але подивимось. Може вдасться щось зробити з тим 1% що в мене є
@javascript Тобі і не потрібно в 100 раз більше, візьми те, що простіше дістати +- в такому об’ємі слів.
@lemmy не прийшло сповіщення про коментар, в настройках включено.
@peaceduck Так, я побачив, що тобі відповідали у коментарі, який тобі не належить (батькивський комент). Додав підтримку згадувань, тепер повинні приходити сповіщення. Додатково з’явилася опція в налаштуваннях сповіщень.