Як знайти медіану вибірки: покроково з прикладами

Коротко:

  • Медіана вибірки — це значення, яке ділить упорядкований ряд даних навпіл: половина спостережень менша або дорівнює їй, половина — більша або дорівнює.
  • Спочатку дані обов’язково сортують за зростанням. Без цього кроку результат буде неправильним.
  • Якщо кількість чисел непарна — беруть середній елемент. Якщо парна — середнє арифметичне двох середніх.
  • Медіана майже не реагує на викиди, тому її часто обирають замість середнього, коли в даних є екстремальні значення.
  • Рахувати можна вручну, у Excel, Google Таблицях або кількома рядками коду на Python.
  • Головна помилка новачків — забути впорядкувати вибірку або плутати медіану із середнім арифметичним.

Медіана вибірки — це те значення, яке стоїть рівно посередині, коли всі числа вибірки вибудувані від найменшого до найбільшого. Половина спостережень лежить ліворуч від неї, половина — праворуч. Саме тому її називають «середнім за положенням», а не за величиною.

На відміну від середнього арифметичного, медіана майже не реагує на кілька дуже великих або дуже малих чисел. Якщо в групі з десяти зарплат одна людина отримує в десять разів більше за інших, середнє «стрибне» вгору, а медіана залишиться на місці. Саме ця властивість робить її зручною для аналізу доходів, цін на житло, результатів тестів і будь-яких даних, де трапляються викиди.

Далі розберемо, як саме її знаходити — від ручного розрахунку до формул у таблицях і коду. Усе з конкретними числами, щоб можна було одразу перевірити на своїх даних.

Що таке медіана вибірки і чим вона відрізняється від середнього

Вибірка — це набір спостережень, які ми реально зібрали. Медіана цієї вибірки показує «центральну» точку саме цього набору. У статистиці її позначають як Me або x̃.

Середнє арифметичне враховує величину кожного числа. Медіана дивиться лише на порядок. Тому коли в даних є сильний перекіс (наприклад, більшість людей отримують 15–25 тисяч гривень, а кілька — по 150–200 тисяч), середнє буде завищеним, а медіана краще покаже, що отримує «типова» людина.

У практиці я часто бачив, як аналітики спочатку дивляться на середнє, а потім перевіряють медіану. Якщо різниця велика — майже завжди виявляється, що в даних є кілька аномальних значень. Медіана в таких випадках рятує від неправильних висновків.

Як знайти медіану вибірки крок за кроком

Алгоритм однаковий для будь-яких числових даних. Головне — не пропускати сортування.

Крок 1. Упорядкувати дані за зростанням

Беремо всі числа вибірки і розставляємо від найменшого до найбільшого. Якщо є однакові значення — вони просто стоять поруч. Цей крок критичний. Без нього медіану знайти неможливо.

Крок 2. Визначити кількість спостережень (n)

Порахувати, скільки чисел у вибірці. Від цього залежить формула.

Крок 3. Застосувати відповідну формулу

  • Якщо n непарне: медіана = значення, яке стоїть на позиції (n + 1) / 2.
  • Якщо n парне: медіана = середнє арифметичне двох чисел, що стоять на позиціях n/2 та n/2 + 1.

Після списку варто запам’ятати просте правило: при непарній кількості «середина» — одне конкретне число, при парній — межа між двома середніми.

Приклади розрахунку медіани

Приклад 1. Непарна кількість спостережень

Вибірка: 7, 3, 9, 2, 5, 8, 4. Тут n = 7 (непарне).

Спочатку сортуємо: 2, 3, 4, 5, 7, 8, 9.

Позиція медіани: (7 + 1) / 2 = 4. Четверте число — 5. Отже, медіана = 5.

Перевірка: ліворуч від 5 стоять три числа, праворуч — теж три. Все збігається.

Приклад 2. Парна кількість спостережень

Вибірка: 12, 5, 18, 9, 7, 15. n = 6 (парне).

Сортуємо: 5, 7, 9, 12, 15, 18.

Два середніх числа — на позиціях 3 і 4: 9 і 12.

Медіана = (9 + 12) / 2 = 10,5.

Зверніть увагу: медіана не обов’язково має бути одним із чисел вибірки. При парній кількості вона часто виходить «між» ними.

Приклад 3. Дані з повтореннями

Вибірка оцінок: 4, 5, 3, 5, 4, 5, 2, 5, 3. n = 9.

Сортуємо: 2, 3, 3, 4, 4, 5, 5, 5, 5.

Позиція: (9 + 1) / 2 = 5. П’яте число — 4. Медіана = 4.

Навіть якщо більшість оцінок — п’ятірки, медіана все одно 4, бо саме це значення ділить ряд навпіл.

Приклад 4. Більша вибірка (зарплати)

Уявімо вибірку місячних зарплат у гривнях (у тисячах): 18, 22, 19, 45, 21, 20, 17, 23, 19, 25, 180, 21.

n = 12. Сортуємо: 17, 18, 19, 19, 20, 21, 21, 22, 23, 25, 45, 180.

Два середніх — 6-е і 7-е: 21 і 21. Медіана = 21.

Середнє арифметичне тут буде близько 35–36 через одну дуже високу зарплату. Медіана ж показує, що типова людина в цій групі отримує близько 21 тисячі. Саме тому в аналізі доходів медіану використовують частіше.

Медіана і середнє арифметичне: коли що обирати

Критерій Медіана Середнє арифметичне
Чутливість до викидів Майже не реагує Сильно змінюється
Що показує Центральне положення Середню величину
Коли зручніша Доходи, ціни, час очікування Рівномірні дані без аномальних значень
Розрахунок Потрібно сортувати Просто сума ділити на кількість

Після таблиці видно головне: якщо дані «чисті» і симетричні — обидва показники близькі. Якщо є сильний перекіс або викиди — медіана дає більш реалістичну картину «типового» значення.

У практиці, коли я дивився на дані про час доставки в одному з інтернет-магазинів, середнє показувало 4,2 дні, а медіана — 2,8. Причина виявилася простою: кілька замовлень «зависли» на 20–30 днів. Медіана краще відображала, скільки насправді чекає більшість клієнтів.

Як знайти медіану в Excel і Google Таблицях

У Excel і Google Таблицях є готова функція MEDIAN.

Синтаксис однаковий: =MEDIAN(діапазон). Наприклад, =MEDIAN(A1:A20).

Функція сама сортує дані всередині і правильно обробляє як парну, так і непарну кількість. Якщо в діапазоні є порожні клітинки або текст — вони ігноруються. Якщо всі клітинки порожні — функція поверне помилку.

Для великих таблиць зручно спочатку відфільтрувати потрібні рядки, а потім застосувати MEDIAN до видимого діапазону. Або використовувати MEDIAN разом з IF у масивних формулах (у новіших версіях Excel — динамічні масиви).

У Google Таблицях все працює так само. Єдиний нюанс — якщо дані оновлюються автоматично, формула перераховується одразу.

Як знайти медіану в Python

Найпростіший спосіб — бібліотека statistics (є в стандартній поставці Python 3.4+):

import statistics
data = [7, 3, 9, 2, 5, 8, 4]
print(statistics.median(data))

Отримаємо 5.0.

Якщо працюєте з pandas (майже завжди при аналізі даних):

import pandas as pd
s = pd.Series([12, 5, 18, 9, 7, 15])
print(s.median())

Результат — 10.5.

У NumPy теж є np.median(). Усі ці функції автоматично сортують і правильно обробляють парну/непарну кількість.

Для дуже великих масивів (мільйони рядків) NumPy і pandas працюють значно швидше, ніж чистий Python.

Типові помилки при розрахунку медіани

  • Забувають сортувати дані. Найчастіша помилка. Без упорядкування результат не має сенсу.
  • Плутають медіану із середнім арифметичним і навпаки. Особливо часто це трапляється, коли в тексті просто пишуть «середнє».
  • При парній кількості беруть не два середніх числа, а одне з них. Або просто вибирають «на око».
  • Включають у розрахунок текстові значення або порожні клітинки і дивуються, чому формула видає помилку.
  • Для згрупованих даних (інтервалів) намагаються застосувати просту формулу для незгрупованих. Там потрібна інша формула з накопиченими частотами.

Після списку помилок варто запам’ятати: завжди спочатку сортуйте. Якщо сумніваєтеся — перевірте на маленькому прикладі вручну, а потім порівняйте з результатом формули.

Медіана для згрупованих даних (коротко)

Іноді дані вже зібрані в інтервали (наприклад, «від 10 до 20 тис. грн — 15 осіб»). Тоді проста формула не підходить. Використовують формулу з накопиченими частотами:

Me = L + ((n/2 − F) / f) × h

де L — нижня межа інтервалу, що містить медіану, F — накопичена частота до цього інтервалу, f — частота медіанного інтервалу, h — ширина інтервалу.

Цей спосіб дає наближене значення. Для точних розрахунків краще мати сирі (незгруповані) дані.

Коли медіана особливо корисна

Медіану варто рахувати майже завжди, коли:

  • аналізуєте доходи, ціни на нерухомість, вартість оренди;
  • дивіться на час очікування, тривалість дзвінків, час відповіді підтримки;
  • оцінюєте результати тестів або іспитів, де кілька людей набрали дуже високі або дуже низькі бали;
  • працюєте з будь-якими даними, де є підозра на викиди.

У соціології та економіці медіану часто публікують разом із середнім саме для того, щоб читач міг оцінити, наскільки «типовим» є середнє значення. Якщо різниця велика — варто шукати причину.

За спостереженнями, коли показуєш замовнику тільки середнє, він часто робить занадто оптимістичні або песимістичні висновки. Коли додаєш медіану — розмова стає предметнішою.

Що робити далі з отриманою медіаною

Після того, як ви знайшли медіану, корисно:

  • порівняти її із середнім арифметичним — різниця покаже наявність викидів;
  • подивитися на квартилі (25 % і 75 %) — вони дають ширшу картину розподілу;
  • побудувати box-plot (ящик з вусами) — медіана там зображена явно;
  • перевірити, як змінюється медіана, якщо прибрати кілька найбільших або найменших значень.

Ці прості кроки перетворюють одне число на справжній інструмент аналізу.

Медіану вибірки знайти нескладно: відсортували — знайшли середину — готово. Головне — не плутати її із середнім і завжди пам’ятати про сортування. Якщо дані вже в таблиці, найшвидший шлях — функція MEDIAN. Якщо працюєте з кодом — statistics.median або pandas.median. А якщо хочете глибше зрозуміти розподіл — дивіться медіану разом із квартилями. Так ви отримаєте набагато повнішу картину, ніж одне лише середнє значення.

Leave a Reply

Your email address will not be published. Required fields are marked *