画像・文書・データ
CSVの重複行を見つけて削除する方法
正しい顧客・商品・注文を誤って統合せず、完全重複を整理します。
すぐ分かる答え
重複を決める前に読み込みを確認します。orders-source.csv は架空の注文 4 件、6 列で、引用符内のカンマ、複数行メモ、アクセント文字、SKU 000123 を含みます。物理的な 1 行が必ず 1 レコードとは限りません。
手順
開いて 4 件・6 列を確認し、フィルターを空にして完全一致の重複を削除、CSV を出力します。再度開くと 3 件になるはずです。orders-eu.csv は別途試し、セミコロンで列が分かれ、12,50 は自動数値変換されない 1 つの文字列であることを確認します。
よくある失敗
Café が文字化けする場合は元アプリから UTF-8 で再出力します。このツールは旧式エンコードの修復器ではありません。カンマを一括で小数点に変えないでください。失われた先頭ゼロは確実に復元できず、受け取り側で SKU を文字列として読み込みます。
完了チェック
注文 1001 は 1 件、1003 は同じ SKU でも数量が違うため残します。000123、Café cup、改行、引用符を再確認します。出力は現在の絞り込み対象なので、全件保存する前にフィルターを解除してください。移行先が受け入れるまで原本を保管します。
具体例で判断する
商品の重複ではなく注文の重複を見る
サンプルには二重出力された注文と、同じ SKU の別の正当な注文があります。列を確認してから全項目が同じ行だけを削除します。
| 確認する点 | 例・操作 | 結果の判断 |
|---|---|---|
| 注文1001が重複 | 六つの項目を比較して一件を削除します。 | 残るのは三レコードです。テキストの物理的な行数とは異なります。 |
| 注文1003も同じ SKU | 数量の違う別注文として保持します。 | SKU、氏名、共有メールだけでは重複と判断できません。 |
| 一列になる・12,50が分かれる | セミコロンサンプルと照らして区切り文字と引用符を確認します。 | 句読点を一括置換しないでください。データ本文の一部の場合もあります。 |
操作例
Boundarysline のサンプルは架空データです。ダウンロードして手順を試せますが、実際の顧客記録や認証済みの成果物ではありません。
| orders-source.csv | 4 × 6 |
|---|---|
| orders-clean.csv | 3 × 6 |
| SKU | 000123 |
| UTF-8 | Café cup |