Блог
Статистика по данным

Отчёт о качестве данных онлайн

Отчёт, который стоит запускать раньше всех остальных. Он профилирует каждый столбец вашей таблицы — сколько пропущено, сколько различных значений, число это или текст, не константа ли, — и считает дубликаты строк. Большинство аналитических ошибок на деле являются проблемами данных, которые он бы поймал.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.

Факты и границы применимости

По каждому столбцу Определённый тип, число пропусков, доля пропусков, число различных значений
Определение типа Числовой, если не меньше 70% непустых ячеек разбираются как числа
Дубликаты строк Точные совпадения по всем столбцам, с подсчётом
Постоянные столбцы Столбцы с одним различным значением или меньше, помечаются отдельно
Худший столбец Тот, где больше всего пропусков, выводится наверху
С чем работает С любой таблицей, числовой или нет

Когда этот метод вводит в заблуждение

Как это считается

Каждый столбец профилируется независимо: считаются его непустые ячейки, считается число различных значений, и он относится к числовым или текстовым по тому, разбираются ли как числа не менее 70% непустых ячеек. Этот порог терпит несколько случайных подписей, не относя по ошибке подлинно числовой столбец к тексту.

Дубликаты строк находятся сравнением полного содержимого строки. Их число выводится на видном месте, потому что дубликаты незаметно раздувают каждую последующую сумму, среднее и корреляцию, а в таблице длиннее экрана они невидимы.

Постоянные столбцы — с одним различным значением или без него — помечаются отдельно. Они не несут информации, ломают корреляцию и регрессию нулевой дисперсией и обычно являются осадком от фильтра, применённого выше по потоку.

Столбец с наибольшим числом пропусков называется наверху вместе с процентом, потому что это то самое число, которое чаще всего решает, стоит ли вообще начинать анализ. Столбец, пустой на 60%, редко выдерживает вывод, который из него хотят сделать.

Вопросы и ответы

Что делать с пропусками?

Сначала выяснить, почему они пропущены. Значения, отсутствующие случайно, часто можно отбросить или восстановить; значения, отсутствующие по причине — клиенты, которые не ответили, станки, которые не отчитались, — несут информацию, и их отбрасывание смещает всё дальнейшее.

Дубликатов ноль, а я их вижу.

Обнаружение требует точного совпадения всех столбцов. Строки, различающиеся отметкой времени, идентификатором или концевым пробелом, точными дубликатами не являются. Уберите различающийся столбец и запустите снова.

Почему столбец почтовых индексов назван числовым?

Потому что его значения разбираются как числа. Определение синтаксическое, а не смысловое. Считайте тип подсказкой: идентификаторы, коды и номера телефонов — это похожий на число текст, который нельзя усреднять.

Откуда в моих данных постоянный столбец?

Обычно это осадок от фильтра — всё выгружено по одному региону, одному году или одному статусу. Он не несёт информации и сломает корреляцию и регрессию, которым для работы нужна дисперсия.

Мои данные загружаются?

Нет. Весь профиль считается в вашем браузере — именно это и делает безопасным его запуск на данных, которые никуда нельзя отправлять.

Похожие утилиты

Все утилиты