Все ноды/Data/DataFrame Ops
DF: уникальные строки
SQL SELECT DISTINCT: удаляет дубликаты по набору колонок.
Тип в графе: df_drop_duplicates
Exec
Можно включить ветку ошибки (expose_error_output) и обработать сбой отдельным путём.
Порты можно разделить на исполнение и данные (split ports).
Как попробовать
Минимальный рабочий воркфлоу
- Исполнение + данные
Запускается сразу
Как применять
Оставляет по одной строке на каждый уникальный набор значений — SQL SELECT DISTINCT. Типичное место — после склейки нескольких выгрузок через df_concat или перед рассылкой, чтобы один адрес не получил два письма. Если кроме схлопывания нужны суммы или средние, берите df_groupby_agg: он делает то же разбиение на группы, но с подсчётом.
Как это работает
Пустой список «Столбцы» означает строгое сравнение: дубликатом считается строка, совпавшая с другой по всем колонкам. Перечислите колонки — и сравнение пойдёт только по ним, а остальные значения будут взяты у той строки, которая уцелела.
Кто уцелеет, решает «Какое вхождение оставить»: first — первая встреченная строка, last —
последняя. Речь именно о порядке строк во входной таблице.
Строки после схлопывания нумеруются заново, с нуля.
Частые ошибки
- «Оставить самую свежую» без сортировки.
firstиlast— это позиция в таблице, а не дата. Поставьте перед нодой df_sort по нужной колонке, и только тогда «последняя» станет «самой свежей». - Ожидание, что уцелевшая строка соберёт значения из отброшенных. Лишние строки отбрасываются целиком; объединять значения умеет df_groupby_agg.
- Сравнение считают «умным». Оно точное:
Иван,иваниИван— три разных значения. Приведите колонку к единому виду заранее — например, через df_update. - Указана колонка, которой нет в таблице, — нода падает. Сверяйте имена по предпросмотру предыдущего шага в журнале запуска.
Входы
| Порт | Провод | Данные | Примечания |
|---|---|---|---|
DataFramedf | Исполнение + данныеexecute_data | dataframe |
Выходы
| Порт | Провод | Данные | Примечания |
|---|---|---|---|
Successoutput | Исполнение + данныеexecute_data | dataframe | |
Erroron_error | Исполнение + данныеexecute_data | — | показывается, когда expose_error_output = true |
Настройки
| Поле | Тип | По умолчанию | Описание |
|---|---|---|---|
Столбцыsubset | array<string> | — | Столбцы, определяющие дубликат (пусто = должны совпасть все столбцы). |
Какое вхождение оставитьkeep | string | first | Какая строка из группы дубликатов остаётся. Варианты: |
Общие поля
Эти три поля есть у каждой ноды: платформа добавляет их сама, а не автор ноды.
expose_error_output— Если включено, показывает выход выполнения для подключения нод, которые запускаются при сбое этого шага.split_ports_in— Показывать отдельные порты входа для выполнения и данных вместо одного объединённого.split_ports_out— Показывать отдельные порты выхода для выполнения и данных вместо одного объединённого.