トップ / フィルタ・サンプリング

distinct / unique

重複行を取り除く。メソッド名がSnowparkとPolarsで異なる点に注意。

SNOWPARK 静的検証のみ

df.distinct()

POLARS 実行確認済み

ldf.unique()

挙動・設計の違い

SnowparkはSELECT DISTINCT *に相当するSQLを発行する。Polarsはハッシュテーブルを使って行の重複を判定し除外する。処理として行うことは同じだが、実装のレイヤーが異なる(SQLエンジン側 vs Polarsのネイティブ実装)。

移行時の落とし穴

メソッド名がそのまま違う(Snowpark: distinct()、Polars: unique())ため、写経のときに書き間違えやすい。Polars側でdistinct()と書いてもメソッドが存在せずエラーになる。

フィルタ・サンプリングの他のメソッド

出典・検証情報

Polars 1.43.2 で実行確認 / Snowpark Python SDK 1.54.0 で静的検証(2026-08-21)