Поиск n-грамм в тексте с учётом словоформ
Каскадный анализ повторяющихся фраз: сначала длинные, потом короткие. Учитывает словоформы русского языка.
Проверим повторы на всём сайте?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайтКак работает каскадный поиск
Инструмент сначала ищет самые длинные повторяющиеся фразы, затем — среди оставшегося текста — фразы покороче, и в конце — отдельные слова. Если фраза «купить билет на самолёт» встретилась три раза, вы не увидите в результате отдельно «купить билет» или «билет на самолёт» — это те же самые вхождения, только урезанные. Смысл в том, чтобы выделить самую содержательную форму повтора, а не заваливать вас списком подстрок.
Что такое учёт словоформ
Прежде чем считать частотность, каждое слово приводится к начальной форме через морфологический анализатор. Формы «купить», «купил», «куплю», «купит» — это одна лемма «купить», и в статистике они складываются. Это принципиально отличается от простого посимвольного подсчёта: без лемматизации русский текст рассыпается на разрозненные словоформы, и вы видите шум вместо реальной картины повторов.
Частые вопросы
Что такое n-грамма?
Что значит «учёт словоформ»?
Зачем нужен параметр «мин. повторов»?
Почему короткая фраза не показывается, если есть длинная?
Можно ли анализировать HTML-страницу?