← ガイド

画像・文書・データ

CSVの重複行を見つけて削除する方法

正しい顧客・商品・注文を誤って統合せず、完全重複を整理します。

すぐ分かる答え

重複を決める前に読み込みを確認します。orders-source.csv は架空の注文 4 件、6 列で、引用符内のカンマ、複数行メモ、アクセント文字、SKU 000123 を含みます。物理的な 1 行が必ず 1 レコードとは限りません。

手順

開いて 4 件・6 列を確認し、フィルターを空にして完全一致の重複を削除、CSV を出力します。再度開くと 3 件になるはずです。orders-eu.csv は別途試し、セミコロンで列が分かれ、12,50 は自動数値変換されない 1 つの文字列であることを確認します。

よくある失敗

Café が文字化けする場合は元アプリから UTF-8 で再出力します。このツールは旧式エンコードの修復器ではありません。カンマを一括で小数点に変えないでください。失われた先頭ゼロは確実に復元できず、受け取り側で SKU を文字列として読み込みます。

完了チェック

注文 1001 は 1 件、1003 は同じ SKU でも数量が違うため残します。000123、Café cup、改行、引用符を再確認します。出力は現在の絞り込み対象なので、全件保存する前にフィルターを解除してください。移行先が受け入れるまで原本を保管します。

具体例で判断する

商品の重複ではなく注文の重複を見る

サンプルには二重出力された注文と、同じ SKU の別の正当な注文があります。列を確認してから全項目が同じ行だけを削除します。

商品の重複ではなく注文の重複を見る
確認する点例・操作結果の判断
注文1001が重複六つの項目を比較して一件を削除します。残るのは三レコードです。テキストの物理的な行数とは異なります。
注文1003も同じ SKU数量の違う別注文として保持します。SKU、氏名、共有メールだけでは重複と判断できません。
一列になる・12,50が分かれるセミコロンサンプルと照らして区切り文字と引用符を確認します。句読点を一括置換しないでください。データ本文の一部の場合もあります。

操作例

Boundarysline のサンプルは架空データです。ダウンロードして手順を試せますが、実際の顧客記録や認証済みの成果物ではありません。

結果の確認
orders-source.csv4 × 6
orders-clean.csv3 × 6
SKU000123
UTF-8Café cup
関連ツールを使うCSVデータ作業台

情報源と関連資料

関連する問題も解決する