Editly

Автор: Vibe Apps Pro Team · Опубліковано: 2026-06-08

Аналіз частоти слів: як знайти задовбані слова у тексті

Знайди слова, які повторюєш забагато, за допомогою онлайн-лічильника частоти слів. Поріг 0.5% для тіка, що нормально, а що переспам, і як це виправити.

Таблиця рейтингу частоти слів, де задовбані змістові слова піднімаються вище порогу повторення 0.5%

Найшвидший спосіб знайти слова, які ти задовбав, — перестати довіряти власному вуху. Ти не чуєш власні словесні тіки — саме тому вони й тіки. Аналіз частоти слів рахує кожне унікальне слово, ранжує їх за частотою появи й показує кожне у відсотках від загальної кількості, тож повторення, яке ти не відчуваєш, стає числом, яке неможливо не помітити.

Ось поріг, що має значення: будь-яке звичайне змістове слово вище 0.5% від твоєї загальної кількості слів варте пильного погляду. У есе на 1000 слів це лише п'ять появ. Нижче — як провести аналіз, правильно його прочитати й виправити те, що він виявить.

Що насправді означає «переспам» (цифри)

Не будь-яке повторення — погане. Англійська (як і українська) за задумом сильно перекошена нагору — жменька службових слів складає величезну частку будь-якого тексту. Це закон Ципфа: найчастіше слово в корпусі з'являється приблизно вдвічі частіше за друге за частотою, втричі частіше за третє, і так далі. У природній англійській саме слово «the» — це приблизно 7% усіх слів. Це не проблема, це граматика.

Крива закону Ципфа: частота слів за рангом, різко падає від високого стовпчика 'the' на рівні 7 відсотків через 'of' і 'and', а тоді вирівнюється в довгий хвіст змістових слів нижче лінії порогу 0.5 відсотка

В українській мові немає артиклів, тож роль, яку в англійській монопольно займає «the», просто зникає — і на верхівці українського частотного списку натомість опиняється розподілена суміш сполучників («і», «та», «а»), прийменників («в», «на», «з») і займенників. Жодне окреме слово зазвичай не претендує на ті самі 7%, бо граматична роль розподілена між більшою кількістю різних словоформ — відмінкові закінчення означають, що «книга/книги/книзі/книгу» не схлопуються в один кошик так, як англійське «book/books» після легкого стемінгу.

Форма кривої вище — це вся історія в одному графіку. Перші кілька стовпчиків — службові слова — височіють над усім іншим, а тоді лінія різко падає й вирівнюється в довгий хвіст. Твої змістові слова живуть у цьому хвості. Коли одне з них вилазить із хвоста й перетинає лінію 0.5%, воно стоїть там, де не мало б стояти. Це візуальна сигнатура словесного тіка.

Тож фокус у тому, щоб знати, які цифри нормальні, а які — червоний прапорець.

Тип словаТипова частотаВердикт
Службові слова (і, в, на, що)2–7%Норма — це закон Ципфа, не чіпай
Твоє ключове слово теми / ім'я персонажа1–3%Очікувано — залежить від контексту, зазвичай нормально
Загальне змістове слово (просто, справді, речі)> 0.5%Ймовірно тік — розслідуй
Прислівник-наповнювач (дуже, власне, буквально)будь-яке скупченняРіж на місці — вони додають водянистості, не сенсу

Причина, чому саме 0.5% — межа: на цьому рівні читач починає помічати слово, навіть підсвідомо. Це та точка, де повторення переходить із невидимого в дратівливе. Лічильник частоти, що показує відсотки, а не лише сирі підрахунки, дозволяє застосовувати цей поріг незалежно від довжини документа.

Щоб порахувати власні цифри, встав свою чернетку в наш Частоту слів — він працює повністю у V8-рушії твого браузера, твій текст ніколи не торкається сервера — і за один прохід ранжує кожне слово з підрахунками й відсотками в реальному часі.

Як читати результати, не обманюючи себе

Рейтинг корисний, лише якщо його правильно інтерпретувати. Три налаштування змінюють те, що ти бачиш, і значення за замовчуванням підібрані саме під це завдання.

1. Тримай «Виключати часті слова» увімкненим. Лічильник фільтрує вбудований список стоп-слів — «і», «в», «та», «що», займенники й ще приблизно 80 інших високочастотних службових слів. Без цього фільтра твій топ-10 — це просто граматика, і ти нічого не дізнаєшся. З увімкненим фільтром перший реальний сигнал — твоє найчастіше повторюване змістове слово — підіймається на вершину списку.

2. Встанови мінімальну довжину слова 4. Це одним рухом пропускає більшість наповнювача («це», «був», «але»), лишаючи слова, що несуть сенс. Підніми до 5 чи 6, якщо твої топ-результати все ще захаращені короткими сполучними словами.

3. Читай колонку відсотків, а не підрахунку. Слово, що з'являється 40 разів, звучить тривожно, поки не усвідомиш, що документ на 30 000 слів — це 0.13%, цілком нормально. Відсоток рахується від загальної кількості слів, включно зі стоп-словами, які ти відфільтрував з відображення, тож це чесний знаменник. Сортуй за відсотком і починай з вершини.

Що ти шукаєш: загальне дієслово чи прикметник, що б'є вище 0.5%. «Показав», «подивився», «важливий», «чудовий», «річ» — ось звичайні підозрювані. Коли одне з них переганяє слова, що реально несуть твій аргумент, ти знайшов тік.

Слова, які автори повторюють, самі того не знаючи

Деякі патерни трапляються майже в кожній чернетці. Прожени аналіз на достатній кількості тексту, і почнеш їх передбачати.

  • Дієслова-милиці: робити, мати, стати, піти. Вони настільки гнучкі, що прослизають усюди. «Зробити рішення» замість «ухвалити рішення», «мати значення» замість точнішого дієслова, «піти на поступки» — кожне ховає сильніше окреме дієслово за слабким. Кумедно, але «зробити рішення» ще й типовий калькований русизм — переспам милиці тут і граматична помилка водночас.
  • Прислівники-прочищання горла: дуже, справді, власне, буквально, просто. Вони скупчуються. Якщо «дуже» з'являється 15 разів, у тебе не проблема з акцентом — у тебе 15 місць, де точне слово перемогло б «дуже + розмите слово».
  • Слова-хеджі: трохи, якось, можливо, мабуть. Одне-два пом'якшують речення; дюжина — і твій текст звучить невпевнено в собі.
  • Слова-затички: річ, штука, момент, аспект. Іменники-заповнювачі, які ти планував замінити й забув.

Це буквально сировина для скорочення обсягу. Щойно ти виявив задовбане дієслово-милицю, техніки зі статті Як зменшити кількість слів перетворюють кожне входження на тугіше, сильніше речення — заміна «вона зробила рішення» на «вона вирішила» одночасно прибирає тік і скорочує кількість слів.

Аналіз частоти проти Пошуку й заміни — використовуй обидва

Знайти задовбане слово — крок перший. Виправити його — крок другий, і для них потрібні різні інструменти.

Лічильник частоти — твоя діагностика: він каже тобі, що «подивився» з'являється 23 рази в розділі на 4000 слів (0.58%, за межею). Він не змінює їх наосліп, і не мусить. Заміна всіх 23 на той самий синонім просто виміняє один тік на інший.

Для виправлення переходь до Пошуку і заміни, який підсвічує кожне входження в контексті, тож ти вирішуєш індивідуально — деякі «подивився» стають «вивчив», деякі «зиркнув», деякі просто прибираються. Він підтримує повний regex із флагом u для Unicode-тексту, тож можна матчити лише цілі слова (/\bподивився\b/giu) і пропускати часткові збіги всередині інших слів. Діагностуй частотою, лікуй пошуком-заміною. Жоден з них не робить добре роботу іншого.

Одна пастка, варта знання, якщо адаптуєш ці патерни: у JavaScript \b працює лише з ASCII, навіть із флагом u. Він чудово працює для looked, але /\bдивився\b/giu чи /\bschön\b/giu можуть дати збій поруч із Unicode-пунктуацією чи нерозривними пробілами, бо рушій не трактує кириличні літери чи літери з умлаутом як «символи слова» на межі. Для надійного матчингу нелатинського тексту прив'язуйся до навколишніх пробілів чи пунктуації замість цього — наприклад, lookaround-и на кшталт /(?<=^|[\s,.])подивився(?=$|[\s,.])/giu — а не покладайся на \b.

Цей цикл «діагностуй, тоді лікуй» — хребет аудиту розділу. Якщо редагуєш художню прозу, гайд з довжини розділу показує, як поєднувати підрахунок слів по розділах з аналізом частоти, щоб зловити тіки, що скупчуються в конкретних сценах — сцени екшену горезвісні тим, що нагромаджують ті самі три дієслова.

Шпаргалка повторень з урахуванням довжини

Поріг 0.5% сталий, але на нього легше діяти як на сирий підрахунок. Ось як виглядає «переспам» при типових довжинах документа.

ДокументПоріг 0.5%Що це означає
Есе на 500 слів~3 входженняТуго — повторення змістового слова 3× уже помітне
Пост у блог на 1000 слів~5 входженьКласичний випадок; 5+ будь-якого не-ключового слова — це тік
Розділ на 2500 слів~13 входженьДієслова — типові порушники тут
Оповідання на 10 000 слів~50 входженьІменам персонажів дозволено; загальним дієсловам — ні
Рукопис на 80 000 слів~400 входженьПрожени по розділах — загальні підсумки по книжці ховають локальні скупчення

Рядок з рукописом містить найважливіше застереження: слово може виглядати нормально по всьому роману і водночас бути напхане в один розділ. Загальна частота по книжці усереднює локальне повторення. Саме тому редактори проводять аналіз по розділах, а не по книжці в цілому — дієслово на 0.1% по всіх 80 000 слів може бути на рівні 1.5% в тій одній сцені, де ти втратив над ним контроль.

Чому токенізатор має значення

Більшість безкоштовних лічильників частоти розбивають текст по пробілах — text.split(' '). Це підхід джуна, і він ламається в ту ж мить, як твій текст містить хоч щось цікаве. «Don't» стає одним токеном; «свекруха-невістка» рахується неправильно замість осмисленого підрахунку; тире—на кшталт цього—склеює два слова разом; а будь-яке нелатинське письмо повертає нісенітницю.

Частоту слів токенізує через Intl.Segmenter, стандартний W3C-детектор меж слів, вбудований у кожен сучасний браузер (саме його використовує власна перевірка орфографії Chrome). Він коректно обробляє скорочення, складені слова з дефісом, символи з діакритикою і навіть китайську чи японську, де між словами взагалі немає пробілів. Якщо твої дані про частоту неправильні через наївний токенізатор, кожен відсоток вище теж неправильний — точність починається з кроку сегментації.

З тієї самої причини, коли тобі потрібна точна загальна кількість слів, щоб перевірити свої відсотки на здоровий глузд, Лічильник слів використовує той самий рушій, тож обидва інструменти завжди узгоджені.

Часті запитання

Що таке аналіз частоти слів? Це процес підрахунку того, скільки разів кожне унікальне слово з'являється в тексті, і ранжування їх від найчастіших до найрідших. Мета — виявити несвідоме повторення: дієслова-милиці й прислівники-наповнювачі, на які ти спираєшся, не усвідомлюючи цього. Показ кожного слова у відсотках від загального відділяє навмисні ключові слова від випадкових тіків.

Як знайти задовбані слова у своєму тексті? Встав текст у лічильник частоти слів, тримай фільтр стоп-слів увімкненим і встанови мінімальну довжину слова 4. Прочитай топ-30 за відсотком. Будь-яке змістове слово вище ~0.5% від загальної кількості — кандидат, це приблизно 5 входжень на 1000 слів. Ігноруй своє ключове слово теми та імена персонажів; цілься в загальні дієслова й прикметники, що несподівано високо ранжуються.

Який відсоток вважається переспамом слова? Службові слова живуть на рівні 2–7%, і це нормально — так просто розподіляється мова. Звичайні змістові слова починають відчуватись як повторення вище приблизно 0.5%, а все, що понад 1% у не-ключовій ролі, майже напевно тік. У художній прозі є виняток: ім'я протагоніста регулярно сидить на 1–3%, нікого не турбуючи.

Чи лічильник частоти слів — те саме, що щільність ключових слів? Та сама математика, протилежна мета. Щільність ключових слів — це SEO: ти хочеш, щоб цільова фраза з'являлась достатньо часто, щоб сигналізувати релевантність, не спрацьовуючи спам-фільтри. Аналіз частоти — це редагування: ти полюєш на повторення, щоб прибрати його. В одному випадку ти женеш число вгору; в іншому — знижуєш його.

Чому лічильник ігнорує слова на кшталт «і» та «та»? Це стоп-слова, і вони очолюють кожен список суто через граматику, топлячи реальний сигнал. Інструмент за замовчуванням фільтрує вбудований список стоп-слів, тож твоє найчастіше повторюване змістове слово натомість підіймається на вершину. Вимкни фільтр, якщо тобі конкретно потрібно вивчити розподіл службових слів.

Чи працює аналіз частоти слів для інших мов? Так — токенізація працює через Intl.Segmenter, який коректно обробляє символи з діакритикою, апострофи, слова з дефісом і письмо без пробілів на кшталт китайського, на відміну від text.split(' '). Утім, вбудований список стоп-слів — англійський, тож для інших мов вимикай фільтр стоп-слів і читай сирий рейтинг.

Часті запитання

Що таке аналіз частоти слів?

Аналіз частоти слів рахує, скільки разів кожне унікальне слово з'являється в тексті, і ранжує результати від найчастіших до найрідших. Це найшвидший спосіб зловити несвідоме повторення — дієслова, прикметники й слова-наповнювачі, на які ти спираєшся, сам того не помічаючи. Хороший лічильник частоти також показує кожне слово у відсотках від загальної кількості, тож можна відрізнити навмисне ключове слово від випадкового словесного тіка.

Як знайти задовбані слова у своєму тексті?

Встав свій текст у частоту слів, виключи часті стоп-слова (і, та, у), і встанови мінімальну довжину слова 4, щоб пропустити наповнювач. Тоді прочитай топ-30 результатів. Будь-яке змістове слово вище приблизно 0.5% від загальної кількості слів варте другого погляду — це приблизно 5 входжень у есе на 1000 слів чи 10 у розділі на 2000 слів. Імена персонажів і твоє основне ключове слово теми очікувано ранжуються високо; загальні дієслова й прикметники, що ранжуються високо, — ось справжні цілі.

Який відсоток вважається переспамом слова?

Для службових слів на кшталт «і» чи «в» 2–7% цілком нормально — так розподіляється будь-яка природна мова (закон Ципфа). Для звичайних змістових слів — дієслів, прикметників, прислівників — усе, що вище приблизно 0.5% від твоєї загальної кількості, починає відчуватись читачем як повторення. Слово, що б'є 1%+ у не-ключовій ролі, майже завжди тік. Виняток — художня проза: ім'я головного персонажа регулярно сидить на рівні 1–3%, і цього ніхто не помічає.

Чи лічильник частоти слів — те саме, що щільність ключових слів?

Вони поділяють математику, але служать різним цілям. Щільність ключових слів — SEO-концепція: ти перевіряєш, чи цільова фраза з'являється достатньо часто (але не настільки часто, щоб виглядати як спам). Аналіз частоти слів — редакторський інструмент: ти полюєш на випадкове повторення, яке хочеш прибрати. Ті самі відсотки, протилежний намір: в одному випадку ти намагаєшся підняти число, в іншому — знизити його.

Чому лічильник ігнорує слова на кшталт «і» та «та»?

Це стоп-слова — високочастотні службові слова, що несуть мало самостійного сенсу. Частоту слів за замовчуванням фільтрує вбудований список стоп-слів, тож сигнал не тоне серед «і», що сидить на вершині кожного списку. Можна вимкнути фільтр, якщо тобі конкретно потрібно вивчити розподіл службових слів, але для пошуку задовбаних змістових слів лиши його увімкненим.

Чи працює аналіз частоти слів для інших мов?

Так. Лічильник токенізує через Intl.Segmenter, стандартний W3C-сегментатор слів, вбудований у сучасні браузери — той самий рушій, який Chrome використовує для перевірки орфографії. Він коректно обробляє апострофи, символи з діакритикою, складені слова з дефісом і навіть письмо без пробілів на кшталт китайського чи японського. Наївний підхід text.split(' '), який використовує більшість саморобних лічильників, повертає сміття на будь-якому з цих випадків. Сам список стоп-слів — англійський, тож нелатинський текст найкраще аналізувати з вимкненим фільтром стоп-слів.

Спробуйте наш безкоштовний лічильник слів

Миттєво рахуйте слова, перевіряйте читабельність та аналізуйте текст.

Відкрити лічильник слів