Все ноды/Data/DataFrame Ops

DF: группировка

SQL GROUP BY + агрегации: задайте колонки группировки и список агрегатов (sum/mean/min/max/count/...).

DF: группировка
DataFrameSuccess
Error

Тип в графе: df_groupby_agg

Exec

Можно включить ветку ошибки (expose_error_output) и обработать сбой отдельным путём.

Порты можно разделить на исполнение и данные (split ports).

Как попробовать

Минимальный рабочий воркфлоу

Вход
DF: группировка
Выход
  • Исполнение + данные
Нажмите «Скопировать ноды», откройте редактор и нажмите Ctrl+V на холсте.

Запускается сразу

Как применять

Схлопывает строки в группы и считает по ним агрегаты — SQL GROUP BY: сумма продаж по менеджерам, число обращений по дням, средний чек по городам. Если считать ничего не нужно, а надо просто убрать повторы, это df_drop_duplicates.

Как это работает

«Столбцы группировки» задают, что считается одной группой: на каждую уникальную комбинацию значений в результат попадает ровно одна строка. Пустые значения из группировки не выпадают — они образуют свою группу.

«Агрегации» — по одной записи на каждую выходную колонку: column (по какой колонке считаем), func (sum, mean, min, max, count, nunique, first, last, std, median) и необязательный alias. Пустой alias даёт имя вида amount_sum.

Результат состоит только из колонок группировки и посчитанных агрегатов. Всё, что не перечислено ни там, ни там, из таблицы исчезает — это не потеря данных, а обычная семантика GROUP BY.

Частые ошибки

  • Ожидание, что остальные колонки сохранятся. Название клиента, город, ссылка — если они нужны в отчёте, добавьте их в агрегаты с функцией first.
  • Два агрегата с одинаковым alias. В результат попадёт только один, без предупреждения. Автоматические имена (amount_sum, amount_mean) не сталкиваются — сталкиваются только вручную заданные одинаковые.
  • count принимают за «число строк в группе». Он считает непустые значения указанной колонки: если в ней есть пропуски, число окажется меньше. Для размера группы выбирайте колонку, где значение есть всегда.
  • Незаполненный список. Проверка графа требует и хотя бы одну колонку группировки, и хотя бы один агрегат.
  • Опечатка в имени колонки — нода падает уже в запуске, до записи результата.

Входы

ПортПроводДанныеПримечания
DataFramedfИсполнение + данныеexecute_datadataframe

Выходы

ПортПроводДанныеПримечания
SuccessoutputИсполнение + данныеexecute_datadataframe
Erroron_errorИсполнение + данныеexecute_data

показывается, когда expose_error_output = true

Настройки

ПолеТипПо умолчаниюОписание
Столбцы группировкиbyarray<string>

Хотя бы один столбец. По одной строке вывода на каждую уникальную комбинацию значений.

Агрегацииaggregationsarray

По одной записи на каждый выходной столбец: исходный столбец, функция, необязательный алиас.

Общие поля

Эти три поля есть у каждой ноды: платформа добавляет их сама, а не автор ноды.

  • expose_error_output — Если включено, показывает выход выполнения для подключения нод, которые запускаются при сбое этого шага.
  • split_ports_in — Показывать отдельные порты входа для выполнения и данных вместо одного объединённого.
  • split_ports_out — Показывать отдельные порты выхода для выполнения и данных вместо одного объединённого.