編集前に生の変換結果を保存する
変換結果は独自のドキュメントとして保持し、レビューが完了するまでソースファイルを保管します。これにより、テキストが欠落していたり順序がおかしかったりする場合の参照が得られ、無関係の未保存ドラフトが上書きされるのを防ぎます。
自動化されたクリーンアップ操作の後は元に戻す機能を使い、変更は一度に1種類にしましょう。大まかな書き直しは、コード内の意図的なスペースを誤って削除したり、すでに正しかったリストのネストを変えたりする可能性があります。
抽出ノイズを除去する
PDFのヘッダー、ページ番号、繰り返されるフッター、スライドのラベル、空のテーブル行、重複した空行は、多くの場合意味を持ちません。繰り返される断片を検索して一貫して削除しますが、実際のコンテンツの一部でもある語句を削除しないよう注意してください。
- コードブロックの外で3行以上連続する空行をまとめる。
- PDFの行末ハイフネーションだけで分割された単語を結合する。
- 全ページに繰り返されるナビゲーションや定型の法的文言を削除する。
- 空の見出しと空のリスト項目を削除する。
論理的な見出しのアウトラインを再構築する
ドキュメントタイトルにはH1を1つ使いましょう。主要セクションは通常H2、サブセクションはH3というように使います。小さく見えるスタイルを得るためだけにレベルを飛ばさないでください。表示はレンダラーに任せるべきです。
変換されたPDFは太字の行を見出しとして過剰に判定する場合があり、逆に手動フォーマットのWordドキュメントではまったく見出しとして判定しない場合があります。アウトラインを目次として読み、意味に基づいてレベルを調整してください。
Before: # Deployment #### Prerequisites ## Linux After: # Deployment ## Prerequisites ### Linux
リストとスペースを正規化する
順序なしリストは1種類のマーカーを使い、ネストには一貫したインデントを使います。リストの前後には空行を1行入れますが、各項目が複数段落を含む場合を除き、短い項目ごとに空行を入れるのは避けましょう。
コンバーターは、番号付き見出しやテーブルのセルをリスト項目と誤認することがあります。順序付きの番号が、ソースのページラベルを反映したものではなく意味を持っていることを確認してください。
狭い画面とソースの可読性のためにテーブルを簡素化する
すべての行のセル数が同じであること、コンテンツ内のパイプ文字がエスケープされていることを確認します。冗長なヘッダーは短くし、長い説明はテーブルの下に移動し、無関係な列グループは分割します。
結合セル、入れ子のテーブル、チャート、スプレッドシートの数式には、信頼できるMarkdownテーブルの対応物がありません。リスト、複数の小さなテーブル、テキスト要約、または維持管理されたソースデータへのリンクに置き換えましょう。
リンク、画像、コードを検証する
HTMLやEPUBから引き継がれた相対リンクは、元の場所に依存します。PDFの抽出はURLを分割することがあり、Officeドキュメントにはリンク先が変わった表示テキストが含まれることがあります。重要なリンクはすべて最終的な出力先で開いて確認してください。
残す画像には説明的な代替テキストを追加します。フェンス付きコードの言語が正しいこと、特殊文字が印刷用文字に変換されていないことを確認します。コピーしたコマンドは、信頼できないコンテンツとしてレビューするまで絶対に実行しないでください。
見た目ではなく意味を仕上げる
名前、日付、数量、コード、決定事項をソースと比較します。ページの位置、スライドの視覚要素、スプレッドシートの色に依存していた文章は書き直します。その後、デスクトップ幅と狭い幅の両方でプレビューし、.mdファイルをダウンロードして、公開システムで検証してください。