Un PDF a due colonne esce con le colonne intrecciate
Selezioni il testo di un articolo composto su due colonne, lo copi, lo incolli in Word — e a una riga della colonna di sinistra ne segue una di destra, e così via. Due discorsi distinti finiscono intrecciati e non si capisce più dove finisca una frase.
Il motivo è che un PDF non conserva alcuna struttura di colonna. Nel file ci sono soltanto istruzioni: «disegna questo glifo a queste coordinate». Da nessuna parte è scritto dove inizia una colonna e dove finisce l'altra. La copia e l'estrazione del testo percorrono la pagina dall'alto in basso, riga per riga, secondo la posizione di disegno: due colonne alla stessa altezza vengono quindi raccolte alternandosi, una riga alla volta.
Le colonne vanno perciò rilette dall'impaginato. PDFIntact individua i blocchi della pagina — testo, titoli, tabelle, figure — e li rimette nell'ordine di lettura prima di scrivere verso Word, Markdown e JSON. L'impaginazione a colonne non viene riprodotta: si ottiene un documento a colonna unica, nell'ordine di lettura.
Provalo ora
Verificalo sul tuo PDF
La verifica avviene interamente nel tuo browser. Il file non viene mai caricato e non serve alcun account. Prima di pagare vedi quante pagine, tabelle e figure si possono estrarre.
Esempio
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
Domande frequenti
- Perché le colonne si intrecciano quando copio un PDF a due colonne?
- Perché un PDF non conserva una colonna in quanto colonna. Nel file c'è solo «disegna questo glifo a queste coordinate», e nulla segna dove inizia una colonna e dove finisce l'altra. La copia percorre la pagina dall'alto in basso, riga per riga: due colonne alla stessa altezza vengono così raccolte alternandosi, una riga alla volta.
- Come viene ripristinato l'ordine di lettura?
- Prima si individuano i blocchi della pagina — testo, titoli, tabelle, figure — poi si rimettono nell'ordine di lettura, e solo allora si scrive. L'impaginazione a due colonne non viene riprodotta: Word e Markdown ricevono un documento a colonna unica, nell'ordine di lettura.
- Che fine fanno note a piè di pagina e didascalie?
- Escono come blocchi a sé, sotto forma di paragrafo, al loro posto nell'ordine di lettura. Nelle nostre prove le didascalie sono rimaste separate dal testo, tutto ciò che stava sotto il filetto della nota è diventato un blocco distinto e i numeri di pagina non si sono mescolati al testo. Non diventano note di Word: arrivano come paragrafi.
- In quali formati si può esportare il testo?
- Word, Markdown e JSON. Il JSON porta anche il tipo di blocco, il numero di pagina e la posizione nella pagina, così puoi risalire a quale colonna e a quale punto appartiene un passo. Il testo corrente non finisce in Excel: un'esportazione Excel contiene solo tabelle e grafici.
- Se l'ordine di lettura è giusto, lo sono anche i caratteri?
- Sono due cose diverse. L'ordine di lettura può reggere mentre la lettura dei caratteri si sfalda, ed è successo su un campione. Per questo ogni blocco porta una fascia di affidabilità: letto, stimato o illeggibile. Confronta sempre il risultato con il PDF originale.
Verifica un PDF su tutti i sintomi/ Che cosa contiene ogni formato