Все ноды/Data/DataFrame Ops

DF: уникальные строки

SQL SELECT DISTINCT: удаляет дубликаты по набору колонок.

DF: уникальные строки
DataFrameSuccess
Error

Тип в графе: df_drop_duplicates

Exec

Можно включить ветку ошибки (expose_error_output) и обработать сбой отдельным путём.

Порты можно разделить на исполнение и данные (split ports).

Как попробовать

Минимальный рабочий воркфлоу

Вход
DF: уникальные строки
Выход
  • Исполнение + данные
Нажмите «Скопировать ноды», откройте редактор и нажмите Ctrl+V на холсте.

Запускается сразу

Как применять

Оставляет по одной строке на каждый уникальный набор значений — SQL SELECT DISTINCT. Типичное место — после склейки нескольких выгрузок через df_concat или перед рассылкой, чтобы один адрес не получил два письма. Если кроме схлопывания нужны суммы или средние, берите df_groupby_agg: он делает то же разбиение на группы, но с подсчётом.

Как это работает

Пустой список «Столбцы» означает строгое сравнение: дубликатом считается строка, совпавшая с другой по всем колонкам. Перечислите колонки — и сравнение пойдёт только по ним, а остальные значения будут взяты у той строки, которая уцелела.

Кто уцелеет, решает «Какое вхождение оставить»: first — первая встреченная строка, last — последняя. Речь именно о порядке строк во входной таблице.

Строки после схлопывания нумеруются заново, с нуля.

Частые ошибки

  • «Оставить самую свежую» без сортировки. first и last — это позиция в таблице, а не дата. Поставьте перед нодой df_sort по нужной колонке, и только тогда «последняя» станет «самой свежей».
  • Ожидание, что уцелевшая строка соберёт значения из отброшенных. Лишние строки отбрасываются целиком; объединять значения умеет df_groupby_agg.
  • Сравнение считают «умным». Оно точное: Иван, иван и Иван — три разных значения. Приведите колонку к единому виду заранее — например, через df_update.
  • Указана колонка, которой нет в таблице, — нода падает. Сверяйте имена по предпросмотру предыдущего шага в журнале запуска.

Входы

ПортПроводДанныеПримечания
DataFramedfИсполнение + данныеexecute_datadataframe

Выходы

ПортПроводДанныеПримечания
SuccessoutputИсполнение + данныеexecute_datadataframe
Erroron_errorИсполнение + данныеexecute_data

показывается, когда expose_error_output = true

Настройки

ПолеТипПо умолчаниюОписание
Столбцыsubsetarray<string>

Столбцы, определяющие дубликат (пусто = должны совпасть все столбцы).

Какое вхождение оставитьkeepstringfirst

Какая строка из группы дубликатов остаётся.

Варианты: first, last

Общие поля

Эти три поля есть у каждой ноды: платформа добавляет их сама, а не автор ноды.

  • expose_error_output — Если включено, показывает выход выполнения для подключения нод, которые запускаются при сбое этого шага.
  • split_ports_in — Показывать отдельные порты входа для выполнения и данных вместо одного объединённого.
  • split_ports_out — Показывать отдельные порты выхода для выполнения и данных вместо одного объединённого.