„Под хаубата“ на Скрол.мк, е технологија развиена со цел да се одговори на желбата - надополнети вести (augmented news).
Тој формат на вести го замисливме на следниов начин:
За да го решиме првиот предизвик, „екстракција“ на најважните (и, што се покажа подоцна, и највистинитите) информации за настанот, идејата ни беше да користиме кластеринг алгоритам. Но, не кластеринг на текстови, туку кластеринг на реченици.
Имено, агрегаторите на вести работат на принципот на групирање на слични вести. Ние одиме чекор понатаму: Во рамките на секој кластер од текстови, ги земаме сите реченици од сите текстови, и бараме кластери од слични реченици.
Како резултат на тоа, добиваме поголеми кластери од слични реченици (информации кои се повторуваат во многу текстови од многу извори, што значи дека се важни - поточно дека има консензус помеѓу различните извори дека тоа е важно и дека е вистина), и помали кластери од слични реченици (информации кои ги има во помал број на текстови, од помалку извори, што значи дека помалку извори сметале дека се важни или дека има помал консензус за нив).
Така добиените кластери од реченици (во рамки на оригиналниот кластер од текстови), ги рангираме по повеќе параметри, како на пример - големина на кластерот, или преовладувачка позиција на реченицата во рамки на текстот од каде што доаѓа (новинарите пишуваат по принципот на превртена пирамида, реченица погоре во новинарски текст има поголема тежина од реченица подолу во текстот).
Како резултат на ова рангирање, добиваме „композитни“ текстови, текстови кои ги составува алгоритам и кои претставуваат преглед на настанот.
Очигледно, користиме сопствено-развиени класични алгоритми, кои работат на ниво на реченица и ги прикажуваат информациите verbatim. Не користиме LLM алатки за сумаризација, кои сеуште го имаат проблемот со измислување на информации.
Следно, во рамки на постоечките кластери од прво ниво, бараме кластери помеѓу насловите на сите текстови. Текстовите често делат слични наслови во определени фази од развојот на некој настан, и тоа може да се искористи за екстракција на главни поенти и да се определи оригиналниот извор на веста. Како резултат на тоа, со сличен алгоритам за рангирање, добиваме листа од најважни наслови и извори кои први ја објавиле таа информација или го покриле тој аспект.
Во третата фаза, повторно со кластерирање, но овој пат кластерирање на цели текстови во рамки на постоечките кластери од прво ниво, креираме субкластери на текстови кои се концентрирани во дадени временски интервали. Овие субкластери ги третираме како точки во кои се случил некој важен поднастан, и од нив креираме временски преглед на главниот настан - timeline.
Следно, во рамки на секој кластер од текстови, правиме препознавање на именувани ентитети (NER). Развивме сопствен алгоритам кој препознава и категоризира имиња на луѓе, локации, и организации, во текстови на македонски јазик. Даваше подобри резултати од библиотеките достапни на Интернет, и затоа сеуште функционираме со него.
На крајот, така направените композитни текстови, ги надополнуваме со:
Правиме експерименти за кластерирање на текстови и реченици на неделно ниво, каде што резултатот ќе биде серија од композитни текстови за настани кои ги одбележале минатите седум дена. Така корисникот може да добие широк преглед на настаните, кој често се губи во дневните вести.
На крајот, нешто што не е техничко, но е поврзано со нашата идеја и концепт за Вести 2.0: Сета оваа содржина која овде ја дискутираме од технички аспект, е креирана од луѓе. Новинари, фотографи, и уредници, кои секојдневно се ангажираат да обезбедат брза и точна информација, инвестираат време и пари, а чиишто производ на Интернет често се добива бесплатно.
Ние сметаме дека Интернет медиумите треба да бидат платени од сите оние кои имаат финансиска корист од нивната содржина.
Најдобар начин за тоа е фер поделба на финансиските приходи на дистрибутерите со креаторите.
Концепт и реализација:
Иван Трајковски, Бојан Лозналиев.
Контакт: info@staging.sup.mk
Рекламирање: advertising@staging.sup.mk