トップ / フィルタ・サンプリング
重複行を取り除く。メソッド名がSnowparkとPolarsで異なる点に注意。
df.distinct()
ldf.unique()
SnowparkはSELECT DISTINCT *に相当するSQLを発行する。Polarsはハッシュテーブルを使って行の重複を判定し除外する。処理として行うことは同じだが、実装のレイヤーが異なる(SQLエンジン側 vs Polarsのネイティブ実装)。
メソッド名がそのまま違う(Snowpark: distinct()、Polars: unique())ため、写経のときに書き間違えやすい。Polars側でdistinct()と書いてもメソッドが存在せずエラーになる。
Polars 1.43.2 で実行確認 / Snowpark Python SDK 1.54.0 で静的検証(2026-08-21)