Автор: Vibe Apps Pro Team · Опубліковано: 2026-06-08
Аналіз частоти слів: як знайти задовбані слова у тексті
Знайди слова, які повторюєш забагато, за допомогою онлайн-лічильника частоти слів. Поріг 0.5% для тіка, що нормально, а що переспам, і як це виправити.

Найшвидший спосіб знайти слова, які ти задовбав, — перестати довіряти власному вуху. Ти не чуєш власні словесні тіки — саме тому вони й тіки. Аналіз частоти слів рахує кожне унікальне слово, ранжує їх за частотою появи й показує кожне у відсотках від загальної кількості, тож повторення, яке ти не відчуваєш, стає числом, яке неможливо не помітити.
Ось поріг, що має значення: будь-яке звичайне змістове слово вище 0.5% від твоєї загальної кількості слів варте пильного погляду. У есе на 1000 слів це лише п'ять появ. Нижче — як провести аналіз, правильно його прочитати й виправити те, що він виявить.
Що насправді означає «переспам» (цифри)
Не будь-яке повторення — погане. Англійська (як і українська) за задумом сильно перекошена нагору — жменька службових слів складає величезну частку будь-якого тексту. Це закон Ципфа: найчастіше слово в корпусі з'являється приблизно вдвічі частіше за друге за частотою, втричі частіше за третє, і так далі. У природній англійській саме слово «the» — це приблизно 7% усіх слів. Це не проблема, це граматика.

В українській мові немає артиклів, тож роль, яку в англійській монопольно займає «the», просто зникає — і на верхівці українського частотного списку натомість опиняється розподілена суміш сполучників («і», «та», «а»), прийменників («в», «на», «з») і займенників. Жодне окреме слово зазвичай не претендує на ті самі 7%, бо граматична роль розподілена між більшою кількістю різних словоформ — відмінкові закінчення означають, що «книга/книги/книзі/книгу» не схлопуються в один кошик так, як англійське «book/books» після легкого стемінгу.
Форма кривої вище — це вся історія в одному графіку. Перші кілька стовпчиків — службові слова — височіють над усім іншим, а тоді лінія різко падає й вирівнюється в довгий хвіст. Твої змістові слова живуть у цьому хвості. Коли одне з них вилазить із хвоста й перетинає лінію 0.5%, воно стоїть там, де не мало б стояти. Це візуальна сигнатура словесного тіка.
Тож фокус у тому, щоб знати, які цифри нормальні, а які — червоний прапорець.
| Тип слова | Типова частота | Вердикт |
|---|---|---|
| Службові слова (і, в, на, що) | 2–7% | Норма — це закон Ципфа, не чіпай |
| Твоє ключове слово теми / ім'я персонажа | 1–3% | Очікувано — залежить від контексту, зазвичай нормально |
| Загальне змістове слово (просто, справді, речі) | > 0.5% | Ймовірно тік — розслідуй |
| Прислівник-наповнювач (дуже, власне, буквально) | будь-яке скупчення | Ріж на місці — вони додають водянистості, не сенсу |
Причина, чому саме 0.5% — межа: на цьому рівні читач починає помічати слово, навіть підсвідомо. Це та точка, де повторення переходить із невидимого в дратівливе. Лічильник частоти, що показує відсотки, а не лише сирі підрахунки, дозволяє застосовувати цей поріг незалежно від довжини документа.
Щоб порахувати власні цифри, встав свою чернетку в наш Частоту слів — він працює повністю у V8-рушії твого браузера, твій текст ніколи не торкається сервера — і за один прохід ранжує кожне слово з підрахунками й відсотками в реальному часі.
Як читати результати, не обманюючи себе
Рейтинг корисний, лише якщо його правильно інтерпретувати. Три налаштування змінюють те, що ти бачиш, і значення за замовчуванням підібрані саме під це завдання.
1. Тримай «Виключати часті слова» увімкненим. Лічильник фільтрує вбудований список стоп-слів — «і», «в», «та», «що», займенники й ще приблизно 80 інших високочастотних службових слів. Без цього фільтра твій топ-10 — це просто граматика, і ти нічого не дізнаєшся. З увімкненим фільтром перший реальний сигнал — твоє найчастіше повторюване змістове слово — підіймається на вершину списку.
2. Встанови мінімальну довжину слова 4. Це одним рухом пропускає більшість наповнювача («це», «був», «але»), лишаючи слова, що несуть сенс. Підніми до 5 чи 6, якщо твої топ-результати все ще захаращені короткими сполучними словами.
3. Читай колонку відсотків, а не підрахунку. Слово, що з'являється 40 разів, звучить тривожно, поки не усвідомиш, що документ на 30 000 слів — це 0.13%, цілком нормально. Відсоток рахується від загальної кількості слів, включно зі стоп-словами, які ти відфільтрував з відображення, тож це чесний знаменник. Сортуй за відсотком і починай з вершини.
Що ти шукаєш: загальне дієслово чи прикметник, що б'є вище 0.5%. «Показав», «подивився», «важливий», «чудовий», «річ» — ось звичайні підозрювані. Коли одне з них переганяє слова, що реально несуть твій аргумент, ти знайшов тік.
Слова, які автори повторюють, самі того не знаючи
Деякі патерни трапляються майже в кожній чернетці. Прожени аналіз на достатній кількості тексту, і почнеш їх передбачати.
- Дієслова-милиці: робити, мати, стати, піти. Вони настільки гнучкі, що прослизають усюди. «Зробити рішення» замість «ухвалити рішення», «мати значення» замість точнішого дієслова, «піти на поступки» — кожне ховає сильніше окреме дієслово за слабким. Кумедно, але «зробити рішення» ще й типовий калькований русизм — переспам милиці тут і граматична помилка водночас.
- Прислівники-прочищання горла: дуже, справді, власне, буквально, просто. Вони скупчуються. Якщо «дуже» з'являється 15 разів, у тебе не проблема з акцентом — у тебе 15 місць, де точне слово перемогло б «дуже + розмите слово».
- Слова-хеджі: трохи, якось, можливо, мабуть. Одне-два пом'якшують речення; дюжина — і твій текст звучить невпевнено в собі.
- Слова-затички: річ, штука, момент, аспект. Іменники-заповнювачі, які ти планував замінити й забув.
Це буквально сировина для скорочення обсягу. Щойно ти виявив задовбане дієслово-милицю, техніки зі статті Як зменшити кількість слів перетворюють кожне входження на тугіше, сильніше речення — заміна «вона зробила рішення» на «вона вирішила» одночасно прибирає тік і скорочує кількість слів.
Аналіз частоти проти Пошуку й заміни — використовуй обидва
Знайти задовбане слово — крок перший. Виправити його — крок другий, і для них потрібні різні інструменти.
Лічильник частоти — твоя діагностика: він каже тобі, що «подивився» з'являється 23 рази в розділі на 4000 слів (0.58%, за межею). Він не змінює їх наосліп, і не мусить. Заміна всіх 23 на той самий синонім просто виміняє один тік на інший.
Для виправлення переходь до Пошуку і заміни, який підсвічує кожне входження в контексті, тож ти вирішуєш індивідуально — деякі «подивився» стають «вивчив», деякі «зиркнув», деякі просто прибираються. Він підтримує повний regex із флагом u для Unicode-тексту, тож можна матчити лише цілі слова (/\bподивився\b/giu) і пропускати часткові збіги всередині інших слів. Діагностуй частотою, лікуй пошуком-заміною. Жоден з них не робить добре роботу іншого.
Одна пастка, варта знання, якщо адаптуєш ці патерни: у JavaScript \b працює лише з ASCII, навіть із флагом u. Він чудово працює для looked, але /\bдивився\b/giu чи /\bschön\b/giu можуть дати збій поруч із Unicode-пунктуацією чи нерозривними пробілами, бо рушій не трактує кириличні літери чи літери з умлаутом як «символи слова» на межі. Для надійного матчингу нелатинського тексту прив'язуйся до навколишніх пробілів чи пунктуації замість цього — наприклад, lookaround-и на кшталт /(?<=^|[\s,.])подивився(?=$|[\s,.])/giu — а не покладайся на \b.
Цей цикл «діагностуй, тоді лікуй» — хребет аудиту розділу. Якщо редагуєш художню прозу, гайд з довжини розділу показує, як поєднувати підрахунок слів по розділах з аналізом частоти, щоб зловити тіки, що скупчуються в конкретних сценах — сцени екшену горезвісні тим, що нагромаджують ті самі три дієслова.
Шпаргалка повторень з урахуванням довжини
Поріг 0.5% сталий, але на нього легше діяти як на сирий підрахунок. Ось як виглядає «переспам» при типових довжинах документа.
| Документ | Поріг 0.5% | Що це означає |
|---|---|---|
| Есе на 500 слів | ~3 входження | Туго — повторення змістового слова 3× уже помітне |
| Пост у блог на 1000 слів | ~5 входжень | Класичний випадок; 5+ будь-якого не-ключового слова — це тік |
| Розділ на 2500 слів | ~13 входжень | Дієслова — типові порушники тут |
| Оповідання на 10 000 слів | ~50 входжень | Іменам персонажів дозволено; загальним дієсловам — ні |
| Рукопис на 80 000 слів | ~400 входжень | Прожени по розділах — загальні підсумки по книжці ховають локальні скупчення |
Рядок з рукописом містить найважливіше застереження: слово може виглядати нормально по всьому роману і водночас бути напхане в один розділ. Загальна частота по книжці усереднює локальне повторення. Саме тому редактори проводять аналіз по розділах, а не по книжці в цілому — дієслово на 0.1% по всіх 80 000 слів може бути на рівні 1.5% в тій одній сцені, де ти втратив над ним контроль.
Чому токенізатор має значення
Більшість безкоштовних лічильників частоти розбивають текст по пробілах — text.split(' '). Це підхід джуна, і він ламається в ту ж мить, як твій текст містить хоч щось цікаве. «Don't» стає одним токеном; «свекруха-невістка» рахується неправильно замість осмисленого підрахунку; тире—на кшталт цього—склеює два слова разом; а будь-яке нелатинське письмо повертає нісенітницю.
Частоту слів токенізує через Intl.Segmenter, стандартний W3C-детектор меж слів, вбудований у кожен сучасний браузер (саме його використовує власна перевірка орфографії Chrome). Він коректно обробляє скорочення, складені слова з дефісом, символи з діакритикою і навіть китайську чи японську, де між словами взагалі немає пробілів. Якщо твої дані про частоту неправильні через наївний токенізатор, кожен відсоток вище теж неправильний — точність починається з кроку сегментації.
З тієї самої причини, коли тобі потрібна точна загальна кількість слів, щоб перевірити свої відсотки на здоровий глузд, Лічильник слів використовує той самий рушій, тож обидва інструменти завжди узгоджені.
Часті запитання
Що таке аналіз частоти слів? Це процес підрахунку того, скільки разів кожне унікальне слово з'являється в тексті, і ранжування їх від найчастіших до найрідших. Мета — виявити несвідоме повторення: дієслова-милиці й прислівники-наповнювачі, на які ти спираєшся, не усвідомлюючи цього. Показ кожного слова у відсотках від загального відділяє навмисні ключові слова від випадкових тіків.
Як знайти задовбані слова у своєму тексті? Встав текст у лічильник частоти слів, тримай фільтр стоп-слів увімкненим і встанови мінімальну довжину слова 4. Прочитай топ-30 за відсотком. Будь-яке змістове слово вище ~0.5% від загальної кількості — кандидат, це приблизно 5 входжень на 1000 слів. Ігноруй своє ключове слово теми та імена персонажів; цілься в загальні дієслова й прикметники, що несподівано високо ранжуються.
Який відсоток вважається переспамом слова? Службові слова живуть на рівні 2–7%, і це нормально — так просто розподіляється мова. Звичайні змістові слова починають відчуватись як повторення вище приблизно 0.5%, а все, що понад 1% у не-ключовій ролі, майже напевно тік. У художній прозі є виняток: ім'я протагоніста регулярно сидить на 1–3%, нікого не турбуючи.
Чи лічильник частоти слів — те саме, що щільність ключових слів? Та сама математика, протилежна мета. Щільність ключових слів — це SEO: ти хочеш, щоб цільова фраза з'являлась достатньо часто, щоб сигналізувати релевантність, не спрацьовуючи спам-фільтри. Аналіз частоти — це редагування: ти полюєш на повторення, щоб прибрати його. В одному випадку ти женеш число вгору; в іншому — знижуєш його.
Чому лічильник ігнорує слова на кшталт «і» та «та»? Це стоп-слова, і вони очолюють кожен список суто через граматику, топлячи реальний сигнал. Інструмент за замовчуванням фільтрує вбудований список стоп-слів, тож твоє найчастіше повторюване змістове слово натомість підіймається на вершину. Вимкни фільтр, якщо тобі конкретно потрібно вивчити розподіл службових слів.
Чи працює аналіз частоти слів для інших мов?
Так — токенізація працює через Intl.Segmenter, який коректно обробляє символи з діакритикою, апострофи, слова з дефісом і письмо без пробілів на кшталт китайського, на відміну від text.split(' '). Утім, вбудований список стоп-слів — англійський, тож для інших мов вимикай фільтр стоп-слів і читай сирий рейтинг.
