Блог
Статистика по данным

Отчёт о качестве данных онлайн

Отчёт, который стоит запускать раньше всех остальных. Он профилирует каждый столбец вашей таблицы — сколько пропущено, сколько различных значений, число это или текст, не константа ли, — и считает дубликаты строк. Большинство аналитических ошибок на деле являются проблемами данных, которые он бы поймал.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

По каждому столбцу Определённый тип, число пропусков, доля пропусков, число различных значений
Определение типа Числовой, если не меньше 70% непустых ячеек разбираются как числа
Дубликаты строк Точные совпадения по всем столбцам, с подсчётом
Постоянные столбцы Столбцы с одним различным значением или меньше, помечаются отдельно
Худший столбец Тот, где больше всего пропусков, выводится наверху
С чем работает С любой таблицей, числовой или нет

Когда этот метод вводит в заблуждение

Как это считается

Каждый столбец профилируется независимо: считаются его непустые ячейки, считается число различных значений, и он относится к числовым или текстовым по тому, разбираются ли как числа не менее 70% непустых ячеек. Этот порог терпит несколько случайных подписей, не относя по ошибке подлинно числовой столбец к тексту.

Дубликаты строк находятся сравнением полного содержимого строки. Их число выводится на видном месте, потому что дубликаты незаметно раздувают каждую последующую сумму, среднее и корреляцию, а в таблице длиннее экрана они невидимы.

Постоянные столбцы — с одним различным значением или без него — помечаются отдельно. Они не несут информации, ломают корреляцию и регрессию нулевой дисперсией и обычно являются осадком от фильтра, применённого выше по потоку.

Столбец с наибольшим числом пропусков называется наверху вместе с процентом, потому что это то самое число, которое чаще всего решает, стоит ли вообще начинать анализ. Столбец, пустой на 60%, редко выдерживает вывод, который из него хотят сделать.

Вопросы и ответы

Что делать с пропусками?

Сначала выяснить, почему они пропущены. Значения, отсутствующие случайно, часто можно отбросить или восстановить; значения, отсутствующие по причине — клиенты, которые не ответили, станки, которые не отчитались, — несут информацию, и их отбрасывание смещает всё дальнейшее.

Дубликатов ноль, а я их вижу.

Обнаружение требует точного совпадения всех столбцов. Строки, различающиеся отметкой времени, идентификатором или концевым пробелом, точными дубликатами не являются. Уберите различающийся столбец и запустите снова.

Почему столбец почтовых индексов назван числовым?

Потому что его значения разбираются как числа. Определение синтаксическое, а не смысловое. Считайте тип подсказкой: идентификаторы, коды и номера телефонов — это похожий на число текст, который нельзя усреднять.

Откуда в моих данных постоянный столбец?

Обычно это осадок от фильтра — всё выгружено по одному региону, одному году или одному статусу. Он не несёт информации и сломает корреляцию и регрессию, которым для работы нужна дисперсия.

Мои данные загружаются?

Нет. Весь профиль считается в вашем браузере — именно это и делает безопасным его запуск на данных, которые никуда нельзя отправлять.

Похожие утилиты

Все утилиты