Antigraviti

Estrarre dati da PDF con Claude: guida pratica per PMI

Davide Ferri 11 min di lettura

Lente d'argento e foglio di vetro in levitazione con un grafico verde muschio dentro: estrarre dati da PDF senza ricopiare a mano

Estrarre dati da PDF con Claude si fa con la skill ufficiale pdf: legge testo e tabelle, unisce o spezza i file, e sulle scansioni passa dall’OCR. Il lavoro sporco resta il controllo a campione: i numeri sbagliati non si vedono da soli.

Ogni settimana una PMI italiana riceve preventivi, DDT, polizze, visure e copie di fattura in PDF. Qualcuno li apre, qualcuno li ricopia in un foglio, qualcuno li inoltra allo studio sperando che «si capisca». Quel ricopiare non produce valore. Produce errori di trascrizione e mezz’ore che non tornano in fattura.

La paura vera, qui, non è «l’AI al posto del commercialista». È farsi una tabella bella e sbagliata, firmarla senza accorgersene, e scoprirlo a consuntivo. Si smonta così: la skill fa il lavoro sporco, voi fate il campione. Non il contrario.

Cosa fa la skill pdf (e cosa non è)

È una Capability Uplift: dà a Claude un mestiere che da solo fa in modo instabile. Senza skill, il modello «vede» il testo del PDF se glielo incollate o se la chat lo estrae alla buona. Con la skill, sceglie lo strumento giusto per il file: testo con layout, tabelle, unione, spezzatino, rotazione, filigrana, OCR, moduli compilabili, protezione con password.

Anthropic la elenca tra le skill documento preinstallate, insieme a Word, Excel e PowerPoint, nella documentazione ufficiale delle Agent Skills. Il codice e le istruzioni stanno nel repository anthropics/skills, che al 18 agosto 2026 supera le 170.000 stelle. Autore: Anthropic, non un plugin di passaggio. La cartella pdf è a licenza proprietaria: si usa dentro Claude, non si copia in giro.

Dentro, la skill non è un prompt lungo. È una guida operativa più file di supporto (reference.md per i casi avanzati, forms.md per i moduli, script per capire se un PDF ha campi compilabili). Claude legge prima nome e descrizione; carica il resto solo quando gli chiedete qualcosa su un .pdf. È lo stesso meccanismo di discovery che abbiamo già raccontato in come funzionano le Claude Skills.

La mappa pratica, da quello che la skill stessa indica come strumento migliore per ogni compito:

CompitoStrumento che usaQuando ha senso in una PMI
Unire o spezzare filepypdf (o qpdf da terminale)tanti allegati da unire prima di spedirli allo studio
Estrarre testo con layoutpdfplumber, o pdftotextcontratti, lettere, condizioni
Estrarre tabellepdfplumberlistini, prospetti, fatture native
PDF scansionatoOCR (pagina → immagine → testo)DDT fotografati, visure vecchie
Creare un PDF nuovoreportlabconferme, report interni
Compilare un moduloprocedura a parte (prima si verifica se i campi sono compilabili)moduli INAIL, banche, assicurazioni

Tre cose che la skill non è. Non è un gestionale. Non è lo SDI. Non è una garanzia sui numeri. Se il PDF è una foto storta di una bolla, l’OCR indovina. Se indovina male una cifra, la tabella esce lo stesso, pulita e sbagliata.

Il PDF è il contenitore scomodo dei dati che già avete: la skill lo apre, non li certifica.

Cosa succedeva prima (il costo del ricopiare)

Il copione è sempre quello. Arriva la mail col PDF. Qualcuno lo scarica sul desktop. Qualcun altro lo riapre dopo tre giorni. I campi utili (fornitore, imponibile, IVA, scadenza, numero) finiscono in un foglio, a mano. Poi il foglio e il PDF si disallineano, perché una fattura è stata stornata e nessuno ha aggiornato la riga.

Su un volume piccolo sembra innocuo. Su decine di documenti a settimana diventa il lavoro invisibile che mangia il lunedì mattina. Peggio: l’errore di una cifra non fa rumore. Fa un sollecito mandato al cliente sbagliato, o una riconciliazione che non torna e che qualcuno sistema «a occhio» la domenica.

È lo stesso buco che abbiamo già visto sul ciclo attivo, quando si parla di automatizzare le fatture: l’emissione è il pezzo facile, il contorno è quello che costa. Qui il contorno è l’ingresso. I PDF dei fornitori e dei clienti restano fuori dal gestionale finché una persona non li traduce in righe.

Il PDF non è il dato. È la fotocopia scomoda del dato. Se lo fate diventare fonte di verità senza un campione, state automatizzando l’errore di battitura. Prima tre file veri, cinque righe controllate, poi il resto.

Valerii Yerokhin, esperto di Antigraviti e CEO di TheDrobot

Questo pezzo lo montiamo, come automazione dei processi ripetitivi, quando il collo di bottiglia è proprio l’ingresso dei documenti, prima ancora del flusso n8n.

Come estrarre dati da PDF senza ricopiare

Il flusso che consigliamo è corto. Non è un progetto IT. È un pomeriggio con tre file veri.

Scegliete tre PDF diversi, non il più pulito

Strumento: cartella mail o disco · 10 minuti

  • Prendete una fattura nativa (testo selezionabile).
  • Prendete un listino o un preventivo con tabella.
  • Prendete una scansione o una foto di un DDT.

Come sai che ha funzionato: sui tre file riuscite a selezionare il testo solo sul primo. Gli altri due sono il test vero.

Accendete la skill, non un prompt nudo

Strumento: claude.ai (piano con skill) o Claude Code · 5 minuti

  • Su claude.ai le skill documento preinstallate (PDF, Word, Excel, PowerPoint) si attivano dalle impostazioni delle Capabilities.
  • Su Claude Code la cartella ufficiale sta nel repository Anthropic: non scaricate zip a caso da directory sconosciute.
  • Se non avete mai caricato una skill, partite dalla [guida di installazione](/blog/claude-skills-cosa-sono/) e tornate qui col prompt.

Come sai che ha funzionato: alla richiesta «estrai la tabella da questo PDF» Claude non chiede che libreria usare. Parte e vi restituisce righe, non una lezione su pypdf.

Incollate il prompt e allegate i file

Strumento: Claude con la skill attiva · 15 minuti

  • Incollate il blocco qui sotto, compilando i campi tra parentesi.
  • Allegate i tre PDF. Un file per volta se il primo giro è disordinato.
  • Chiedete esplicitamente i campi che vi servono: non «tutto», cinque colonne.
Devi estrarre dati da PDF per una piccola impresa italiana.

File: [nome del PDF allegato]
Tipo: [fattura di cortesia / preventivo / listino / DDT / contratto / altro]
Campi obbligatori, in quest'ordine:
1. data documento
2. numero documento
3. fornitore o cliente (ragione sociale)
4. partita IVA se c'è
5. imponibile
6. IVA
7. totale
8. scadenza pagamento se c'è

Regole:
- Se un campo non si legge, scrivi NON LETTO. Non inventare.
- Se il file è una scansione, dillo in cima e indica la qualità ( pulita / storta / illeggibile ).
- Restituisci una tabella e, sotto, tre righe di note: cosa hai letto bene, cosa è incerto, cosa va ricontrollato a mano.
- Non confondere il PDF di cortesia di una fattura elettronica con l'XML fiscale. Se sospetti che esista un XML, segnalalo.
- Valuta ogni riga: alta / media / bassa confidenza.

Alla fine proponi SOLO i tipi di documento che, su questo campione, merita automatizzare.

Come sai che ha funzionato: in tabella compare almeno un NON LETTO o una confidenza media. Se è tutto «alta» su una scansione brutta, non vi fidate: il modello sta coprendo i buchi.

Controllate cinque righe sull’originale

Strumento: PDF originale + tabella · 10 minuti

  • Aprite il PDF, non la tabella. Confrontate numero, data, totale, partita IVA.
  • Segnate con un sì o un no ogni riga del campione.
  • Se sbaglia una cifra critica, quel tipo di file resta fuori dall'automatismo.

Come sai che ha funzionato: avete un verdetto scritto (passa / non passa) per ciascuno dei tre tipi, non una sensazione.

Mandate avanti solo ciò che ha passato il campione

Strumento: foglio o n8n · 20 minuti

  • I PDF nativi che tornano al 100% sul campione possono entrare in una cartella «da estrarre».
  • Le scansioni restano a mano, o passano da uno scanner decente prima dell'OCR.
  • Se il passo successivo è il ciclo fatture, ricollegatevi al [flusso su emissione e solleciti](/blog/automatizzare-fatture/): qui avete solo sbloccato l'ingresso.

Come sai che ha funzionato: in cartella ci sono due pile, non una. «Si può estrarre» e «si fa a mano». La pila unica è come prima, solo più veloce a sbagliare.

Dove si rompe (e come si corregge)

Il primo incidente è la scansione. La skill lo sa e passa dall’OCR: pagina resa come immagine, poi testo. Funziona su una fotocopia dritta. Su una foto di cellulare, col dito sul timbro e l’ombra del neon, confonde 8 e 3, 1 e 7. La correzione non è «un prompt migliore». È un file migliore, o la battitura dei campi che non potete sbagliare.

Il secondo è il modulo. Un PDF può sembrare un modulo e non avere campi compilabili: è solo un disegno di caselle. La skill, sul serio, vi obbliga a controllare prima se i campi esistono (ha persino uno script apposta). Se saltate quel controllo e chiedete «compilalo», ottenete un PDF che sembra riempito e i sistemi a valle lo leggono vuoto.

Il terzo è italiano al cento per cento: la fattura elettronica. Quella che vale per l’Agenzia delle Entrate è l’XML passato dal Sistema di Interscambio. Il PDF che vi arriva in mail è una copia di cortesia. Estrarre dal PDF ha senso per archivio e controllo rapido. Per la contabilità, chiedete l’XML o il tracciato del gestionale. Altrimenti state rileggendo la fotocopia e ignorando il file strutturato. È lo stesso principio che vale quando si parla di agenti AI in uno studio: si delega la ricopiatura, non la responsabilità del dato fiscale.

Il quarto è la memoria del modello. Su un PDF lungo, pypdf da solo è indicato come scelta debole; la skill preferisce pdfplumber o pdftotext, e sui file enormi lavora a pezzi. Se gli chiedete «riassumimi le 200 pagine» senza dire cosa vi serve, otterrete un riassunto vago e vi sembrerà che «Claude non funziona sui PDF». Funziona. Gli avete chiesto il compito sbagliato.

Il quinto è la licenza. La skill è ufficiale e proprietaria. Non va incollata in un repository aziendale «perché è su GitHub». Si usa nel perimetro Anthropic. Le librerie che chiama (pypdf, pdfplumber, reportlab, pypdfium2) sono invece open source, ciascuna con la sua licenza. Distinguere le due cose evita discussioni inutili col consulente informatico.

Cosa deve essere vero prima di delegare

Tre condizioni, non negoziabili.

Uno: avete i file originali, non screenshot di screenshot. Due: sapete quali cinque campi vi servono, e li avete scritti. Tre: una persona con il mestiere (voi, il commercialista, l’amministrazione) accetta di fare il campione ogni volta che cambia il tipo di documento. Un nuovo fornitore con un layout nuovo è un tipo nuovo. Si ritesta.

Se manca la terza, non installate niente. Avete solo spostato l’errore dal foglio alla chat.

Cosa fare lunedì

Non «adottare l’AI sui documenti». Fate una cosa sola: prendete i tre PDF di venerdì scorso, incollate il prompt, confrontate cinque righe. Segnate sul calendario se quel tipo di file è passato o no.

Il lunedì dopo, solo i tipi passati finiscono nella cartella da estrarre. Il resto resta il lavoro di sempre, senza la finzione che sia sparito.

Il ricopiare a mano ha un vantaggio che nessuno dice: quando sbagliate, vi accorgete perché vi fa male il polso. L’estrazione automatica è silenziosa. Per questo il campione non è un optional da consulenti. È l’unico freno che avete. Usatelo lunedì, su tre file, prima di promettere a qualcuno che «i PDF li fa l’AI».

Domande frequenti

Serve saper programmare per estrarre dati da PDF con Claude?

No, se lavorate su claude.ai: caricate il file e chiedete la tabella o il riassunto. Il codice (pypdf, pdfplumber, OCR) lo esegue Claude quando serve. Programmare aiuta solo se volete incastrare l'estrazione in un flusso notturno, per esempio con n8n.

La skill pdf è gratuita?

La skill in sé non si compra a parte. Pagate l'abbonamento a Claude che abilita le skill. Il repository ufficiale anthropics/skills ha superato le 170.000 stelle, ma la cartella pdf è a licenza proprietaria Anthropic: si usa dentro i servizi Anthropic, non si ridistribuisce.

Funziona sulle fatture elettroniche italiane?

Sul PDF di cortesia sì, con verifica. Il file fiscale vero è l'XML passato dallo SDI: quello va letto come XML, non come PDF. Se mandate al commercialista solo estrazioni da PDF, potete perdere campi obbligatori che nell'XML ci sono già strutturati.

Cosa succede con un PDF scansionato storto?

La skill passa dall'OCR (immagine della pagina, poi testo). Su una scansione pulita recupera l'essenziale. Su una foto di cellulare storta, con ombre o timbri sopra i numeri, sbaglia cifre. Quei file si riallineano o si digitano a mano i campi critici.