処理範囲と入力データの取り扱い
CSVファイルはブラウザ内だけで解析され、外部へ送信・保存されません。
データ・ログ
ファイルを選ぶだけでCSVの構造と注意点を自動診断します。内容を変換・修復せず、確認すべき行や列を表示します。
またはファイルを選択
UTF-8・UTF-8 BOMありの.csv、最大10MB。カンマ・セミコロン・タブを自動判定します。
要確認・注意は検出件数、正常は該当のない診断項目数です。すべてのCSV仕様や取込先との互換性を保証するものではありません。
先頭20レコード・100列、セルは先頭80文字まで。開始行はファイルの物理行番号です。引用符内の改行ではレコードを分割しません。
CSVファイルはブラウザ内だけで解析され、外部へ送信・保存されません。
列数ずれ、引用符の不整合、区切り文字の違い、改行コードの混在、重複ヘッダー、空行などで、CSVの取込結果が意図と異なる場合があります。BOMや空セルにも正常な用途があり、すべてをエラーとは扱いません。
先頭30レコードまでを候補ごとに解析し、複数列の一貫性と根拠となるレコード数を比較します。候補が同程度の場合や単列のファイルは「区切り文字を判定できませんでした」と表示します。
先頭の非空レコードに数値以外の非空欄があればヘッダー候補と推定します。ヘッダーの存在を確定するものではなく、先頭データをヘッダーと見なす場合もあります。基準列数はヘッダー候補の列数、候補がなければ最頻列数です。
値の中のカンマが引用符で囲まれていないと、別のセルとして扱われる場合があります。列数不一致はレコードの開始行と「期待列数・実際列数」で確認できます。欠列と空セルは別に扱い、自動補完しません。
RFC 4180を基本に、カンマや改行を含む値は二重引用符で囲みます。値の中の引用符は二重にして、"He said ""hello"""のように表します。閉じ引用符がない、引用符の位置が不正等の場合は診断を未完了とし、それ以降を確定したデータとして扱いません。
UTF-8 BOMはファイル先頭のEF BB BFという3バイトです。あり・なしのどちらもあり得るため情報として表示します。UTF-8として厳密にdecodeできない場合、別の文字コードの可能性を案内しますが、Shift_JIS等と断定・変換しません。
CRLF・LF・CRを区別し、複数種類があれば注意を表示します。引用符内の改行も文字コード情報に含めますが、CSVのレコード区切りとは別に集計します。最終改行の有無そのものは問題ではありません。
先頭空白を除いたセルが=・+・-・@で始まる場合、表計算ソフトで数式として解釈される可能性があります。-123等の通常の符号付き数値は除外します。このToolはセル内容を自動変更しません。実際の解釈は取込先により異なります。
10MB・100,000レコード・10,000列・1,000,000セルを解析上限とします。上限超過は未完了として明示します。要確認・注意は種類ごとに全文を集計し、詳細は先頭100件まで、前後空白の詳細は先頭5件です。長大セルは10,000コードポイント以上、長大レコードはUTF-8で1MiB超、空セルが多い列は空セル率50%以上という固定基準です。内容の正しさや品質の良し悪しを断定しません。