重点:2/3 难度:1/3

Duplicate Row Filter 重复行过滤节点。在 KNIME 4.0 版本之前,都是没有重复行过滤节点的。但这并不代表之前版本的 KNIME 不能处理重复行问题。在没有这个节点时,可以使用 `GroupBy` 节点来处理重复行的问题。在 4.0 版本之后,有了这个节点,处理重复行问题就更方便了。重复行节点配置中可以让用户选择一行中某几列相同,就可以认为是重复行。我们可以把重复行去除,也可以进行标记保留。标记保留时,会使用 unique、chosen、duplicate 三种状态来进行标识,而保留的原则可以是第一次出现重复、最后一次出现重复,也可以对选定之前相同行认定排除出去不进行比较的列中最大或最小的那一行进行保留。这个节点比较简单,如果想要实验,可以直接下载[这个链接中的 workflow](https://hub.knime.com/knime/spaces/Examples/latest/02_ETL_Data_Manipulation/01_Filtering/08_Filtering_Duplicates) 进行练习掌握。

Duplicate Row Filter相同行判定选择页

Duplicate Row Filter高级选项页

值得一提的是这个节点的来历:KNIME 曾经发了一份用户问卷调查,作为对用户的感谢,他们挑出社区成员最想要的一个节点并进行实现。而去除重复行就是这个大家都要求的节点!KNIME 不止给了去除重复行的功能,如我们所见,这个节点还可以选定一些策略进行选择和标记。另外,KNIME 社区还有一个叫做 feature request 的子板块,如果你觉得某个功能是用的特别频繁的,可以去给他们提建议!当然,你也可以自己完成节点功能,贡献给社区。

相关文章