トップ / フィルタ・サンプリング
指定した列の値が一致する行を重複とみなして間引く。
df.drop_duplicates("user_id")
ldf.unique(subset=["user_id"], keep="first")
Snowparkは内部的にROW_NUMBER() OVER (PARTITION BY user_id ORDER BY ...)のようなウィンドウ関数を含むサブクエリに展開して重複行を除く。Polarsは指定列のハッシュ値をもとに、keep引数で指定した方針(最初/最後/いずれか1件)で1行だけを残す。
事前に明示的なソートをしていない場合、複数の重複行のうち「どの1行が残るか」の決定ロジックがエンジン間で異なる可能性がある。特定の行を残したい場合は、drop_duplicates/uniqueの前に必ずソートしておく。
Polars 1.43.2 で実行確認 / Snowpark Python SDK 1.54.0 で静的検証(2026-08-21)