Мода. медиана. генеральная и выборочная средняя
Содержание:
- Пример использования
- Typed XML
- Об этой статье
- Какие способы вычисления среднего бывают?
- Отличия определений
- Особенности использования функции МЕДИАНА в Excel
- В чём фокус?
- The median function
- The math
- Среднее гармоническое
- The function
- Шаги
- Самая распространенная заработная плата в России и насколько она ниже средней? Почему у 70% людей зарплата ниже среднего уровня?
- Среднее геометрическое
- Неуникальность значения
- Общая характеристика
- Мода
Пример использования
Предположим, что в одной комнате оказалось 19 бедняков и один миллионер. У каждого бедняка есть 5 ₽, а у миллионера — 1 млн ₽ (106). В сумме получается 1 000 095 ₽. Если мы разделим деньги равными долями на 20 человек, то получим 50 004,75 ₽. Это будет среднее арифметическое значение суммы денег, которая была у всех 20 человек в этой комнате.
Медиана в этом случае будет равна 5 ₽ (полусумма десятого и одиннадцатого, срединных значений ранжированного ряда). Можно интерпретировать это следующим образом. Разделив всю компанию на две равные группы по 10 человек, мы можем утверждать, что в первой группе у каждого не больше 5 ₽, во второй же — не меньше 5 ₽. В общем случае можно сказать, что медиана — это то, сколько принёс с собой «средний» человек. Наоборот, среднее арифметическое — неподходящая характеристика, так как оно значительно превышает сумму наличных, имеющуюся у среднего человека.
Typed XML
Since we’re passing an XML argument, we want to be able to parse this XML blob as efficiently as possible, and for this purpose, I’ve created a schema collection. You could do without one, but applying the schema will dramatically improve the XML parsing performance.
The schema is very simple – a bunch of <value> elements with numeric (“double”) values.
CREATE XML SCHEMA COLLECTION Calc.ValueListSchema AS ' <xsd:schema xmlns:xsd="http://www.w3.org/2001/XMLSchema"> <xsd:element name="value" type="xsd:double" /> </xsd:schema>';
Here’s an example of what the XML argument could look like:
<value>1.0</value> <value>2.0</value> <value>3.0</value> ...
Об этой статье
wikiHow работает по принципу вики, а это значит, что многие наши статьи написаны несколькими авторами. При создании этой статьи над ее редактированием и улучшением работали, в том числе анонимно, 11 человек(а). Количество просмотров этой статьи: 214 791.
Категории: Математика
English:Find Mean, Median, and Mode
Português:Encontrar Média, Mediana e Moda
Italiano:Trovare Media, Mediana e Moda
Français:calculer la moyenne, la médiane et le mode d’une série statistique
Nederlands:Het gemiddelde, de mediaan en de modus bepalen
Deutsch:Mittelwert, Zentralwert und Modalwert berechnen
Bahasa Indonesia:Mencari Nilai Mean, Median, dan Modus
Čeština:Jak zjistit aritmetický průměr, medián a modus
हिन्दी:माध्य,माध्यिका,और बहुलक प्राप्त करें
ไทย:หาค่าเฉลี่ย มัธยฐาน และฐานนิยม
Tiếng Việt:Tìm Mean, Median, và Mode
한국어:평균, 중앙값, 최빈값 구하는 방법
Español:calcular promedios (media, mediana y moda)
中文:计算均值(平均数,中位数,众数)
Печать
Какие способы вычисления среднего бывают?
Первым способом является вычисление уже упомянутого среднего арифметического, являющегося суммой всех значений, деленной на их количество.
Формула:
- x– среднее арифметическое;
- xn – конкретное значение;
- n – количество значений.
Плюсы:
- Хорошо работает при нормальном распределении значений в выборке;
- Легко вычислить;
- Интуитивно понятно.
Минусы:
- Не дает реального представления о распределении значений;
- Неустойчивая величина легко поддающаяся выбросам (как в случае с генеральным директором).
Вторым способом является вычисление моды, то есть наиболее часто встречающегося значения.
Формула:
- M– мода;
- x– нижняя граница интервала, который содержит моду;
- n – величина интервала;
- fm– частота (сколько раз в ряду встречается то или иное значение);
- fm-1 – частота интервала предшествующего модальному;
- fm+1 – частота интервала следующего за модальным.
Плюсы:
- Прекрасно подходит для получения представления об общественном мнении;
- Хорошо подходит для нечисловых данных (цвета сезона, хиты продаж, рейтинги);
- Проста для понимания.
Минусы:
- Моды может просто не быть (нет повторов);
- Мод может быть несколько (многомодальное распределение).
Третий способ — это вычисление медианы, то есть значения, которое делит упорядоченную выборку на две половины и находится между ними. А если такого значения нет, то за медиану принимается среднее арифметическое между границами половин выборки.
Формула:
- Me – медиана;
- x– нижняя граница интервала, который содержит медиану;
- h – величина интервала;
- f i – частота (сколько раз в ряду встречается то или иное значение);
- Sm-1 – сумма частот интервалов предшествующих медианному;
- fm – число значений в медианном интервале (его частота).
Плюсы:
- Дает самую реалистичную и репрезентативную оценку;
- Устойчива к выбросам.
Минусы:
Сложнее вычислить, так как перед вычислением выборку нужно упорядочить.
Мы рассмотрели основные методы нахождения среднего значения, называющиеся мерами центральной тенденции (на самом деле их больше, но это наиболее популярные).
А теперь давайте вернемся к нашему примеру и посчитаем все три варианта среднего при помощи специальных функций Excel:
- — функция для определения среднего арифметического;
- — функция моды (в более старых версиях Excel использовалась );
- — функция для поиска медианы.
И вот какие значения у нас получились:
В данном случае мода и медиана гораздо лучше характеризуют среднюю зарплату в компании.
Но что делать, когда в выборке не 10 значений, как в примере, а миллионы? В Excel это не посчитать, а вот в базе данных где хранятся ваши данные, без проблем.
Вычисляем среднее арифметическое на SQL
Тут все достаточно просто, так как в SQL предусмотрена специальная агрегатная функция .
И чтобы ее использовать достаточно написать вот такой запрос:
/* Здесь и далее salary - столбец с зарплатами, а employees - таблица сотрудников в нашей базе данных */ SELECT AVG(salary) AS 'Средняя зарплата' FROM employees
Вычисляем моду на SQL
В SQL нет отдельной функции для нахождения моды, но ее легко и быстро можно написать самостоятельно. Для этого нам необходимо узнать, какая из зарплат чаще всего повторяется и выбрать наиболее популярную.
Напишем запрос:
/* WITH TIES необходимо добавлять к TOP() если множество многомодально, то есть у множества несколько мод */ SELECT TOP(1) WITH TIES salary AS 'Мода зарплаты' FROM employees GROUP BY salary ORDER BY COUNT(*) DESC
Вычисляем медиану на SQL
Как и в случае с модой, в SQL нет встроенной функции для вычисления медианы, зато есть универсальная функция для вычисления процентилей .
Выглядит все это так:
/* В данном случае процентиль 0.5 и будет являться медианой */
SELECT TOP(1) PERCENTILE_CONT(0.5)
WITHIN GROUP (ORDER BY salary)
OVER() AS 'Медианная зарплата'
FROM employees
Подробнее о работе функции лучше почитать в справке Microsoft и .
Отличия определений
Формулировка и определение
Медиана делит последовательность пополам, причем 1 часть состоит из элементов, меньших этой величины, а 2 часть состоит из больших чисел. Среднее арифметическое — это сумма всех элементов, деленная на их количество.
Данные в некоторых случаях совпадают, однако чаще всего они имеют разные значения.
Точность вычислений
Среднее арифметическое дает неточный итог подведения статистики, особенно если данных слишком много. Некоторые статисты заменяют его модой — элемент, который чаще всего встречается в последовательности. В частных случаях необходимо использовать среднее геометрическое, так как арифметическое дает неточный результат. Оценить эффективность величины можно только после применения его на практике, изучения всех значений последовательности и вычисления других статистических характеристик.
Медиана является более точной величиной, чем другое множество.
Однако для эффективной статистики необходимо учитывать сразу несколько показателей.
Применение
Для большинства обывателей медиана — это не статистическая величина, а математическая. Она чаще применяется в геометрических задачах на треугольники, как отрезок или луч. Многие даже не знают, что данное определение применимо к статистике. Его используют только при специализированных отчетах, для подведения итога. В устных докладах переменную не озвучивают, однако в документации ее необходимо описывать.
Среднее арифметическое также применяется в математике, однако в статистике оно известно не меньше. Его часто используют в СМИ, политике и экономике. Эта переменная изучается на начальной стадии обучения статистике.
Для большинства обывателей среднее арифметическое — более понятная величина, несмотря на то, что она неточна во многих случаях.
Особенности использования функции МЕДИАНА в Excel
Функция имеет следующий синтаксис:
=МЕДИАНА(число1;;…)
Описание аргументов:
- число1 – обязательный аргумент, характеризующий первое числовое значение, содержащееся в исследуемом диапазоне;
- – необязательный второй (и последующие аргументы, всего до 255 аргументов), характеризующий второе и последующие значения исследуемого диапазона.
Примечания 1:
- При расчетах удобнее передавать сразу весь диапазон исследуемых значений вместо последовательного ввода аргументов.
- В качестве аргументов принимаются данные числового типа, имена, содержащие числа, данные ссылочного типа и массивы (например, =МЕДИАНА({1;2;3;5;7;10})).
- При расчете медианы учитываются ячейки, содержащие пустые значения или логические ИСТИНА, ЛОЖЬ, которые будут интерпретированы как числовые значения 1 и 0 соответственно. Например, результат выполнения функции с логическими значениями в аргументах (ИСТИНА;ЛОЖЬ) эквивалентен результату выполнения с аргументами (1;0) и равен 0,5.
- Если один или несколько аргументов функции принимают текстовые значения, которые не могут быть преобразованы в числовые, или содержат коды ошибок, результатом выполнения функции будет код ошибки #ЗНАЧ!.
- Для определения медианы выборки могут быть использованы другие функции Excel: ПРОЦЕНТИЛЬ.ВКЛ, КВАРТИЛЬ.ВКЛ, НАИБОЛЬШИЙ Примеры использования:
- =ПРОЦЕНТИЛЬ.ВКЛ(A1:A10;0,5), поскольку по определению медиана – 50-я процентиль.
- =КВАРТИЛЬ.ВКЛ(A1:A10;2), так как медиана – 2-я квартиль.
- =НАИБОЛЬШИЙ(A1:A9;СЧЁТ(A1:A9)/2), но только если количество чисел в диапазоне является нечетным числом.
Примечания 2:
- Если в исследуемом диапазоне все числа распределены симметрично относительно среднего значения, среднее арифметическое и медиана для данного диапазона будут эквивалентны.
- При больших отклонениях данных в диапазоне («разбросе» значений) медиана лучше отражает тенденцию распределения значений, чем среднее арифметическое. Отличным примером является использование медианы для определения реального уровня зарплат у населения государства, в котором чиновники получают на порядок больше обычных граждан.
- Диапазон исследуемых значений может содержать:
- Нечетное количество чисел. В этом случае медианой будет являться единственное число, разделяющее диапазон на два подмножества больших и меньших значений соответственно;
- Четное количество чисел. Тогда медиана вычисляется как среднее арифметическое для двух числовых значений, разделяющих множество на два указанных выше подмножества.
В чём фокус?
Среднее гармоническое действительно не самая очевидная вещь. Дело в том, что если бы у вас было две разных установки, одна из которых работает со скоростью 10 деталей/час, а другая — 20 деталей/час, конечно, их средняя производительность составляла бы 15 деталей/час. В этом случае вы имеете полное право просто сложить их производительность и вычислить среднее арифметическое, ведь установки работают независимо друг от друга.
Если не верите в среднее гармоническое, можно устроить себе обратную проверку. Мы утверждаем, что наша универсальная установка по заготовке и полировке деталей справляется с 7,14 деталями в час. Проверим: мы знаем, что за час машина либо обрабатывает 25 деталей, либо полирует 10. Получаем:
Подготовка: 7,14/25 = 0,29 часов Полировка: 7,14/10 = 0,71 часов
Да-да, 0,29 + 0,71 = 1, цифры работают: для полного цикла изготовления 7,14 деталей действительно требуется один час.
The median function
Here’s the finished product (in the form of a multi-statement table valued function).
CREATE FUNCTION Calc.Median(
@values xml(Calc.ValueListSchema)=NULL
)
RETURNS @out TABLE (
median numeric(28, 8) NOT NULL,
PRIMARY KEY CLUSTERED (median)
)
WITH SCHEMABINDING
AS
BEGIN;
--- Variable declaration
DECLARE @rowcount int=0;
--- Our work table where we're going to store all the values
DECLARE @tbl TABLE (
val numeric(28, 8) NOT NULL,
ident int IDENTITY(1, 1) NOT NULL,
PRIMARY KEY CLUSTERED (val, ident)
);
--- Extract the values from the XML blob into @tbl
INSERT INTO @tbl (val)
SELECT v.n.value('.', 'numeric(28, 8)') AS val
FROM @values.nodes('/value') AS v(n);
SET @rowcount=@@ROWCOUNT;
IF (@rowcount=0) RETURN;
--- Calculate the median, store the single output row in @out
INSERT INTO @out (median)
SELECT AVG(val)
FROM (
SELECT t.val
FROM @tbl AS t
ORDER BY t.val
OFFSET (@rowcount-1)/2 ROWS FETCH NEXT 2-@rowcount%2 ROWS ONLY
) AS sub;
RETURN;
END;
Note: schemabinding a function can improve performance even if it never references any objects in the database. Because SQL Server knows that this object won’t reference any so-called user data, it can sometimes eliminate Table Spool operators in the query plan, which gives you a more efficient plan.
The math
Medians as a concept are simple enough. If you have a large number of values, like a range of statistical values, you want to pick the middle one. The median, as opposed to the average is useful for a number of reasons, one of them that you can reduce the effect of so-called outlier values.
For example, in the range {1, 2, 3, 4, 5, 6, 7, 8, 9, 1000}, the average will be 104.5, but that’s really not an accurate reflection on the range. The reason that the average is “skewed” is obviously the number 1000, known as an outlier in this range. The median is the “middle” number in the range, and because we have an even number of values in this example, the median is going to be the average of the two middle values, {5, 6}, i.e. 5.5. This is the most common way to calculate the median of an even number of values, but not the only one. And as I’m not a mathematician, I won’t go into detail on the different methods and applications.
Среднее гармоническое
Среднее гармоническое представить сложнее, чем предыдущих представителей «средних», но оно не менее полезно. Между прочим, само понятие «гармоники» в математике связано с обратными числами (1/2, 1/3 и т.д.). Среднее гармоническое помогает нам вычислить среднее арифметическое в рядах чисел, заданных обратными значениями. Это бывает чаще, чем можно подумать.
Например, если я еду со скоростью 30 км/ч, это значит, что я получаю определённый результат (30 км) за какую-либо единицу времени (1 час). Когда мы хотим узнать среднее значение для нескольких скоростей (Х и Y), нужно думать о результате и единицах измерения, а не об исходных цифрах.
CредняяCкорость = \frac{ОбщийРезультат}{ОбщаяЕдиницаИзмерения}
Возьмём двух сотрудников: Х и Y. Оба работают в одном проекте и выполняют одинаковое количество работы, но скорость их работы разная. Какова средняя скорость их работы?
Допусти, каменщик Х кладёт 30 кирпичей в час, а каменщик Y — 60 кирпичей в час. Значит, на один кирпич у каждого каменщика уходит:
- У X укладка одного кирпича займёт 1/X времени (1/30);
- У Y укладка одного кирпича займёт 1/Y времени (1/60)
Складываем результаты и единицы измерения:
Общий результат: 2 кирпича (Х и Y уложили по одному) Общая единица времени: 1/X + 1/Y (у каждого уходит разное количество времени)
Средней скоростью обоих каменщиков будет:
\frac{2}{\frac{1}{X} + \frac{1}{Y}}
Если бы у нас было 3 каменщика (X, Y и Z), их средняя скорость вычислялась бы по формуле:
\frac {3}{\frac{1}{X} + \frac{1}{Y} + \frac{1}{Z}}
Здорово же иметь одну формулу вместо того, чтобы каждый раз заниматься долгими вычислениями. Даже вычисляя среднюю скорость 5 нерадивых работников стало бы головной болью. Помните наш первый пример про скорость, с которой вы едете на работу и домой? Чтобы найти среднюю скорость передвижения в тот день, мы просто используем формулу.
При этом нам даже не нужно знать, где находится дом или офис! Теперь вместо X и Y у нас не кирпичи, а количество километров за единицу времени. Вне зависимости от расстояния результат один и тот же: допустим, некое количество километров R мы проходим на скорости X, а другое количество километров R — на скорости Y. Средняя скорость при этом будет вычисляться так же, как вычисляется средняя скорость прохождения 1 км на скорости X и одного километра на скорости Y:
\frac{2R}{\frac{R}{30} + \frac{R}{60}} = \frac{2}{\frac{1}{30} + \frac{1}{60}} = 40
Ключевая идея: Среднее гармоническое используется тогда, когда один и тот же объём работы выполняется с разной производительностью.
Ещё более ключевая идея: Помните, что среднее значение — это один элемент, способный передать суть целой группы элементов. В нашем примере с работой и офисой в среднем туда-обратно мы едем на скорости 40 км/ч (вместо 30 км/ч туда и 60 км/ч обратно)
Важно помнить, что средней скоростью мы заменяем каждую «стадию»
Ещё несколько примеров из жизни среднего гармонического:
- Передача данных: Мы передаём данные между клиентом и сервером. С Клиента берут 1 доллар за 10 трафика, а Сервер на 1 доллар получает 20 Гб трафика. Каково среднее количество Гб, которые можно передать и получить за один доллар? Мы усредняем значения для клиента и для сервера: 2 / (1/10 + 1/20) = 13,3 Гб/доллар для каждой стороны. Поскольку данные и передаются, и получаются (каждая сторона выполняет свою половину работу), мы делим это значение на 2 и получаем следующее значение: 6,65 Гб за доллар.
- Производительность машины: У нас есть производственная установка для подготовки и полировки деталей. За час установка может подготовить 25 деталей; либо за тот же час она может отполировать 10 деталей. Какова средняя производительность установки? Усредняем значения для каждой стадии: 2 / (1/25 + 1/10) = 14,28 деталей/час. Снова делим это значение на два, поскольку нас интересует средняя производительность установки, если она занимается сразу двумя фазами: получаем 7,14 деталей/час.
The function
The most elegant (and most efficient) way to calculate a median in SQL Server that I’ve seen so far is using the new OFFSET-FETCH clause, which is available as of SQL Server 2012. In an ordered set, OFFSET determines the starting row number and FETCH the number of rows returned from that starting row. For example, this query will return the 10 next rows starting with row 100 in the defined order:
SELECT * FROM Booking.Tickets ORDER BY TicketID OFFSET 100 ROWS FETCH NEXT 10 ROWS ONLY;
Now imagine if all the statistical values that we want to calculate a median on are ordered, and given that we know the number of values, you could use OFFSET and FETCH to return just the middle one or two values from that set.
SELECT AVG(val) FROM ( SELECT t.val FROM @tbl AS t ORDER BY t.val OFFSET (@count-1)/2 ROWS FETCH NEXT 2-@count%2 ROWS ONLY ) AS sub;
Let’s break this query down:
- @tbl contains all of the values in the column val.
- @count is the number of rows in @tbl. We’re going to use this @count to calculate the correct offset and number of rows to return.
- (@count-1)/2 performs an integer division of (@count-1), so for odd @count values, it’ll round the result down. In this case, when @count is 10, the OFFSET (10-1)/2 will be rounded down to 4, and if @count is 9, (9-1)/2 is also 4.
- 2-@count%2 returns 2 for even values of @count and 1 for odd values of @count. Remember that when we have an even number of values, we want the average of the two middle values, whereas if @count is odd, simply a single middle value is used.
- Finally, the subquery is aggregated with an AVG() for those cases when we have two values.
Шаги
Метод 1 из 3:
Как найти среднее значение
-
1
Сложите все числа, которые вам даны. Допустим, вам даны числа 2, 3 и 4. Сложим их: 2 + 3 + 4 = 9.
-
2
Сосчитайте количество чисел. У нас есть три цифры.
-
3
Разделите сумму чисел на их количество. Берем 9, делим на 3. 9/3 = 3. Среднее значение в данном случае равно 3. Помните, что не всегда получается целое число.
Метод 2 из 3:
Как найти медиану
-
1
Запишите все числа, которые вам даны, в порядке возрастания. Например, нам даны числа: 4, 2, 8, 1, 15. Запишите их от меньшего к большему, вот так: 1, 2, 4, 8, 15.
-
2
Найдите два средних числа. Мы расскажем, как это сделать, если у вас имеется четное количество чисел, и как это сделать, если количество чисел нечетное:
- Если у вас нечетное количество чисел, вычеркните левое крайнее число, затем правое крайнее число и так далее. Один оставшийся номер и будет искомой медианой. Если вам дан ряд чисел 4, 7, 8, 11, 21, тогда 8 — медиана, так как 8 стоит посередине.
- Если у вас четное количество чисел, вычеркните по одному числу с каждой стороны, пока у вас не останется два числа посередине. Сложите их и разделите на два. Это и есть значение медианы. Если вам дан ряд чисел 1, 2, 5, 3, 7, 10, то два средних числа — это 5 и 3. Сложим 5 и 3, получим 8, разделим на два, получим 4. Это и есть медиана.
Метод 3 из 3:
Как найти моду
-
1
Запишите все числа в ряд. Например, вам даны числа 2, 4, 5, 5, 4 и 5. Запишите их в порядке возрастания.
-
2
Найдите число, которое чаще всего встречается. В данном случае это 5. Если два числа встречаются одинаково часто, то этот ряд двухвершинный или бимодальный, а если больше — то мультимодальный.
Самая распространенная заработная плата в России и насколько она ниже средней? Почему у 70% людей зарплата ниже среднего уровня?
Заработная плата – основной источник доходов людей в России (63% в 2020 году). В официальной российской статистике традиционно используется показатель средней зарплаты, но насколько она отражает реальный уровень компенсации труда сотрудников и как соотносится с самой распространенной и срединной (медианной) зарплатами?
Для корректной оценки уровня заработной платы необходимо понять, что означает средняя зарплата и почему общество не всегда ей доверяет.
Средняя заработная плата в России.
Наиболее используемым показателем в России, как среди официальных лиц, там и среди ученых, является средняя заработная плата. Она представляет собой все начисленные работникам деньги (фонд оплаты труда с учетом подоходного налога), деленные на численность работников в месяц. В 2019 году (апрель 2019 г.) средняя заработная плата в России составляла 47,6 тыс. рублей в месяц до вычета подоходного налога или 41,5 тыс. руб в месяц после уплаты налога.
Показатель средней зарплаты часто критикуется, поскольку из-за большого расслоения по доходам населения, не отражает средний уровень компенсации труда.
Медианная заработная плата в России.
Медианная заработная плата – срединная зарплата, при которой половина (50%) работников получает меньше этого уровня, а половина – больше. В 2019 году (апрель 2019 г.) медианная заработная плата в России – 34 тыс. рублей (29,9 тыс. руб после уплаты налога) или 72% от уровня средней зарплаты. Из этого следует, что половина работающего населения в России зарабатывает (после вычета налога) меньше 30 тыс. рублей или 2,6 прожиточного минимума трудоспособного гражданина.
Медианная заработная плата редко используется в России, а ее публикации носят выборочных характер. В США медианная оплата труда анализируется наравне со средней для более релевантной оценки благосостояния населения, хотя отношение медианной зарплаты к средней близко к российскому уровню (74%).
Модальная или самая распространенная заработная плата в России.
Модальная заработная плата – самая часто встречающаяся зарплата, то есть это наиболее распространенная среди населения России. В 2019 года (апрель 2019 г.) модальная зарплата в России составила 23,5 тыс. рублей (20,5 тыс. рублей после вычета налога) или менее 50% показателя средней зарплаты.
Уровень модальной заработной платы равен 2 прожиточным минимумам. Это свидетельствует о том, что значительная часть работающего населения живет в бедности, вынуждена экономить на базовых потребительских товарах и не имеет возможности накапливать деньги.
Распределение работников по заработной плате.
Около 20% работающих россиян в 2019 году имели заработную плату менее 20 тыс рублей (17,4 тыс. после вычета налога), а средний уровень заработной платы (47,7 тыс. руб) недостижим для 70% работников.
Более 100 тыс
рублей в месяц зарабатывают только 7% населения России, которых можно отнести к среднему классу и выше (исключительно по финансовому критерию, не беря во внимание прочие факторы)
Самая распространенная заработная плата в России и насколько она ниже средней? Почему у 70% людей зарплата ниже среднего уровня?
Почему 70% людей зарабатывают меньше средней зарплаты?
Даже незначительная доля высокооплачиваемых работников на фоне низких зарплат у большой части населения способны приводить к таким статистическим перекосам. Рассмотрим пример, который наглядно иллюстрирует эту статистическую особенность. В компании трудится 10 работников — 5 человек имеют зарплату 20 тыс. рублей, 4 человека — 30 тыс. рублей и 1 человек — 200 тыс. рублей. Средняя зарплата у сотрудников компании составит 42 тыс. рублей, медианный уровень — 25 тыс. рублей, а модальный (самый распространённый) — 20 тыс. рублей.
На основе данных по распределению заработных плат в России и приведённого примера видно, что медианный или модальный показатели зарплат точнее характеризуют реальный уровень благосостояния населения, нежели средняя заработная плата.
Детализация по средней, медианной и модальной зарплатам приводится для крупных и средних предприятий (для отработавших полный апрель 2019 года сотрудников) без учета малых компаний и индивидуальных предпринимателей. Но средняя зарплата по указанной выборке близка к обобщенному показателя по всем организациям в России — 47,5 тыс руб в месяц (против 47,7 тыс руб в месяц по крупным и средним компаниям), что позволяет применять значения медианной и модальной зарплат на всех занятых в России.
Среднее геометрическое
Наш «репрезентативный элемент» зависит от того, что мы делаем с уже существующими элементами группы данных. В большинстве случаев элементы просто складываются и среднее арифметическое работает прекрасно. Но иногда нужно нечто большее. Например, когда мы анализируем инвестиции, площади и объёмы. В таких случаях между собой данные взаимодействуют именно путём умножения (ожидаемая доходность, объём или площадь фигуры вычисляются с помощью умножения), и это меняет подход к выявлению и смыслу средних значений.
Вот пример. Какой инвестиционный портфель вы предпочтёте? Иными словами, какой из них принесёт большую прибыль в течение типового года?
- Портфель А: +10%, -10%, +10%, -10%
- Портфель Б: +30%, -30%, +30%, -30%
Выглядят похоже. Повседневная логика, построенная на привычке к среднему арифметическому, говорит, что оба портфеля достаточно рискованны и оба в среднем приведут к убыткам или нулевой прибыли. Поэтому, вероятнее всего, надо выбрать портфель Б, поскольку в успешный год он принесёт больше прибыли.
Но это в корне неверно! На фондовом рынке с таким подходом мы с вами точно прогорим. Проценты с инвестиций умножаются, но не складываются. Мы не можем просто взять и использовать среднее арифметическое, нужно найти действительный коэффициент окупаемости. Коэффициент окупаемости считается достаточно просто: берём условные 100% нашего текущего капитала в качестве единицы. Далее представляем колебания доходности-убытка, представленные в описании портфелей, добавляя к нашей единице или вычитая из неё процентные показатели. Затем перемножаем полученные колебания и получаем коэффициент. Для расчёта среднегодового значения коэффициента окупаемости делим полученный коэффициент на 4 (поскольку элементов в нашем числовом ряду четыре).
Портфель А:
Коэффициент окупаемости: 1,1 \times 0,9 \times 1,1 \times 0,9 = 0,98 (2% убытка)
Среднегодовое значение: 0,98^{1/4} = 0,5\% годового убытка
Портфель Б:
Коэффициент окупаемости: 1,3 \times 0,7 \times 1,3 \times 0,7 = 0,83 (17% убытка)
Среднегодовое значение: 0,83^{1/4} = 4,6\% годового убытка
Выбор между 2% или 17%? Огромная разница! Конечно, только идиот, а не разумный человек будет делать выбор именно из этих двух портфелей, но если делать выбор, то из двух зол лучше выбрать Портфель А. И именно здесь среднее арифметическое не работает.
Несколько примеров, где работает среднее геометрическое:
- Темпы инфляции: У вас есть показатели в 1%, 2% и 10%. Каков средний показатель инфляции за конкретный период времени? (1,01 \times 1,02 \times 1,10)^{1/3} = 4,3\%.
- Скидки: У вас есть три скидочных купона на 50%, 25% и 35%. Какова средняя скидка? (0,5 \times 0,75 \times 0,65)^{1/3} = 37,5%.
- Площадь: У вас есть участок земли 40х60 м. Вам нужно вычислить «усреднённую сторону» — иными словами, сторону квадрата примерно той же площади. (40 \times 60)^{0,5} = 49 м.
- Объём: У вас есть коробка 12 х 24 х 48 см. Вам снова нужна усреднённая сторона, то есть сторона куба примерно того же объёма. (12 \times 24 \times 48)^{1/3} = 24 см.
Среднее геометрическое помогает найти «типичный элемент» среди группы элементов, взаимодействующих друг с другом путём умножения. И, как видим, у него есть множество практических применений.
Неуникальность значения
Если имеется чётное количество случаев и два средних значения различаются, то медианой, по определению, может служить любое число между ними (например, в выборке {1, 3, 5, 7} медианой может служить любое число из интервала (3,5)). На практике в этом случае чаще всего используют среднее арифметическое двух средних значений (в примере выше это число (3+5)/2=4). Для выборок с чётным числом элементов можно также ввести понятие «нижней медианы» (элемент с номером n/2 в упорядоченном ряду из n{\displaystyle n} элементов; в примере выше это число 3) и «верхней медианы» (элемент с номером (n+2)/2; в примере выше это число 5). Эти понятия определены не только для числовых данных, но и для любой порядковой шкалы.
Общая характеристика
Оба статистических термина применяются для обработки данных, выявления статистики и подведения итогов. В частных случаях данные переменные могут иметь равные значения.
Терминами пользуются в разных научных сферах, например в математике. Среднее арифметическое имеет в алгебре и статистике одинаковые определение и формулы. Медиана в математике применяется в геометрии — это отрезок, проведенный из угла треугольника к противолежащей этому углу стороне, и делящий сторону на 2 равных отрезка.
Для подробной статистики используются одновременно оба термина, вместе с другими переменными (мода, частота, выбросы и пр.). Это позволяет более точно оценить собранные данные о подсчетах доходов и расходов, измерениях температуры, объема воды и др.
Если все числа совокупности равны, то числа переменных будут равными и равны всем элементам последовательности.
Мода
Само слово может звучать странно, но оно означает всего лишь наиболее часто встречающийся в группе элемент. На практике обычно мода определяется путём опросов и сбора мнений. Да, действительно порой бывают случаи, когда лучшим способом получить наиболее репрезентативный образец данных является сбор откликов.
Ну, скажем, вы планируете вечеринку, и вам нужно выбрать день для её проведения. Дни недели — такой же числовой ряд, что и любой другой. Это всего лишь числа от 1 до 7. Среднее арифметическое и медиана тут не помогут (Лиза и Паша могут в пятницу, а Коля и Петя — в воскресенье; поэтому назначим субботу). Что делать в таком случае? Конечно, выбрать тот день, который выберет большинство.
Как правило, мода используется для получения наиболее репрезентативного значения в нечисловых рядах. Популярные цвета в сезоне, хиты продаж, рейтинги фильмов и музыки, лучшие кафе и закусочные определяются именно по моде.

Преимущества моды: — Прекрасно работает для получения представления об общественном мнении; — Даёт представление о потребностях большой части людей (там, где среднее арифметическое даёт лишь осечку); — Проста для понимания.
Недостатки моды: — Для её вычисления требуется больше усилий (нужно собрать мнения и обработать их); — Победителю достаётся всё: мода выявляет только одного лидера.
