Все ноды/Data/DataFrame Ops
DF: группировка
SQL GROUP BY + агрегации: задайте колонки группировки и список агрегатов (sum/mean/min/max/count/...).
Тип в графе: df_groupby_agg
Exec
Можно включить ветку ошибки (expose_error_output) и обработать сбой отдельным путём.
Порты можно разделить на исполнение и данные (split ports).
Как попробовать
Минимальный рабочий воркфлоу
- Исполнение + данные
Запускается сразу
Как применять
Схлопывает строки в группы и считает по ним агрегаты — SQL GROUP BY: сумма продаж по менеджерам, число обращений по дням, средний чек по городам. Если считать ничего не нужно, а надо просто убрать повторы, это df_drop_duplicates.
Как это работает
«Столбцы группировки» задают, что считается одной группой: на каждую уникальную комбинацию значений в результат попадает ровно одна строка. Пустые значения из группировки не выпадают — они образуют свою группу.
«Агрегации» — по одной записи на каждую выходную колонку: column (по какой колонке считаем),
func (sum, mean, min, max, count, nunique, first, last, std, median) и
необязательный alias. Пустой alias даёт имя вида amount_sum.
Результат состоит только из колонок группировки и посчитанных агрегатов. Всё, что не перечислено ни там, ни там, из таблицы исчезает — это не потеря данных, а обычная семантика GROUP BY.
Частые ошибки
- Ожидание, что остальные колонки сохранятся. Название клиента, город, ссылка — если они
нужны в отчёте, добавьте их в агрегаты с функцией
first. - Два агрегата с одинаковым
alias. В результат попадёт только один, без предупреждения. Автоматические имена (amount_sum,amount_mean) не сталкиваются — сталкиваются только вручную заданные одинаковые. countпринимают за «число строк в группе». Он считает непустые значения указанной колонки: если в ней есть пропуски, число окажется меньше. Для размера группы выбирайте колонку, где значение есть всегда.- Незаполненный список. Проверка графа требует и хотя бы одну колонку группировки, и хотя бы один агрегат.
- Опечатка в имени колонки — нода падает уже в запуске, до записи результата.
Входы
| Порт | Провод | Данные | Примечания |
|---|---|---|---|
DataFramedf | Исполнение + данныеexecute_data | dataframe |
Выходы
| Порт | Провод | Данные | Примечания |
|---|---|---|---|
Successoutput | Исполнение + данныеexecute_data | dataframe | |
Erroron_error | Исполнение + данныеexecute_data | — | показывается, когда expose_error_output = true |
Настройки
| Поле | Тип | По умолчанию | Описание |
|---|---|---|---|
Столбцы группировкиby | array<string> | — | Хотя бы один столбец. По одной строке вывода на каждую уникальную комбинацию значений. |
Агрегацииaggregations | array | — | По одной записи на каждый выходной столбец: исходный столбец, функция, необязательный алиас. |
Общие поля
Эти три поля есть у каждой ноды: платформа добавляет их сама, а не автор ноды.
expose_error_output— Если включено, показывает выход выполнения для подключения нод, которые запускаются при сбое этого шага.split_ports_in— Показывать отдельные порты входа для выполнения и данных вместо одного объединённого.split_ports_out— Показывать отдельные порты выхода для выполнения и данных вместо одного объединённого.