Automazioni che Funzionano
Automatizzare Excel: cosa togliere dal foglio (e cosa no)
Automatizzare Excel conviene su ricopiatura, controlli e invii ripetuti tra fogli: la decisione e l'eccezione restano a chi guarda i numeri ogni giorno.
Estrarre dati da PDF con Claude si fa con la skill ufficiale pdf: legge testo e tabelle, unisce o spezza i file, e sulle scansioni passa dall’OCR. Il lavoro sporco resta il controllo a campione: i numeri sbagliati non si vedono da soli.
Ogni settimana una PMI italiana riceve preventivi, DDT, polizze, visure e copie di fattura in PDF. Qualcuno li apre, qualcuno li ricopia in un foglio, qualcuno li inoltra allo studio sperando che «si capisca». Quel ricopiare non produce valore. Produce errori di trascrizione e mezz’ore che non tornano in fattura.
La paura vera, qui, non è «l’AI al posto del commercialista». È farsi una tabella bella e sbagliata, firmarla senza accorgersene, e scoprirlo a consuntivo. Si smonta così: la skill fa il lavoro sporco, voi fate il campione. Non il contrario.
È una Capability Uplift: dà a Claude un mestiere che da solo fa in modo instabile. Senza skill, il modello «vede» il testo del PDF se glielo incollate o se la chat lo estrae alla buona. Con la skill, sceglie lo strumento giusto per il file: testo con layout, tabelle, unione, spezzatino, rotazione, filigrana, OCR, moduli compilabili, protezione con password.
Anthropic la elenca tra le skill documento preinstallate, insieme a Word, Excel e PowerPoint, nella documentazione ufficiale delle Agent Skills. Il codice e le istruzioni stanno nel repository anthropics/skills, che al 18 agosto 2026 supera le 170.000 stelle. Autore: Anthropic, non un plugin di passaggio. La cartella pdf è a licenza proprietaria: si usa dentro Claude, non si copia in giro.
Dentro, la skill non è un prompt lungo. È una guida operativa più file di supporto (reference.md per i casi avanzati, forms.md per i moduli, script per capire se un PDF ha campi compilabili). Claude legge prima nome e descrizione; carica il resto solo quando gli chiedete qualcosa su un .pdf. È lo stesso meccanismo di discovery che abbiamo già raccontato in come funzionano le Claude Skills.
La mappa pratica, da quello che la skill stessa indica come strumento migliore per ogni compito:
| Compito | Strumento che usa | Quando ha senso in una PMI |
|---|---|---|
| Unire o spezzare file | pypdf (o qpdf da terminale) | tanti allegati da unire prima di spedirli allo studio |
| Estrarre testo con layout | pdfplumber, o pdftotext | contratti, lettere, condizioni |
| Estrarre tabelle | pdfplumber | listini, prospetti, fatture native |
| PDF scansionato | OCR (pagina → immagine → testo) | DDT fotografati, visure vecchie |
| Creare un PDF nuovo | reportlab | conferme, report interni |
| Compilare un modulo | procedura a parte (prima si verifica se i campi sono compilabili) | moduli INAIL, banche, assicurazioni |
Tre cose che la skill non è. Non è un gestionale. Non è lo SDI. Non è una garanzia sui numeri. Se il PDF è una foto storta di una bolla, l’OCR indovina. Se indovina male una cifra, la tabella esce lo stesso, pulita e sbagliata.
Il PDF è il contenitore scomodo dei dati che già avete: la skill lo apre, non li certifica.
Il copione è sempre quello. Arriva la mail col PDF. Qualcuno lo scarica sul desktop. Qualcun altro lo riapre dopo tre giorni. I campi utili (fornitore, imponibile, IVA, scadenza, numero) finiscono in un foglio, a mano. Poi il foglio e il PDF si disallineano, perché una fattura è stata stornata e nessuno ha aggiornato la riga.
Su un volume piccolo sembra innocuo. Su decine di documenti a settimana diventa il lavoro invisibile che mangia il lunedì mattina. Peggio: l’errore di una cifra non fa rumore. Fa un sollecito mandato al cliente sbagliato, o una riconciliazione che non torna e che qualcuno sistema «a occhio» la domenica.
È lo stesso buco che abbiamo già visto sul ciclo attivo, quando si parla di automatizzare le fatture: l’emissione è il pezzo facile, il contorno è quello che costa. Qui il contorno è l’ingresso. I PDF dei fornitori e dei clienti restano fuori dal gestionale finché una persona non li traduce in righe.
Il PDF non è il dato. È la fotocopia scomoda del dato. Se lo fate diventare fonte di verità senza un campione, state automatizzando l’errore di battitura. Prima tre file veri, cinque righe controllate, poi il resto.
Valerii Yerokhin, esperto di Antigraviti e CEO di TheDrobot
Questo pezzo lo montiamo, come automazione dei processi ripetitivi, quando il collo di bottiglia è proprio l’ingresso dei documenti, prima ancora del flusso n8n.
Il flusso che consigliamo è corto. Non è un progetto IT. È un pomeriggio con tre file veri.
Strumento: cartella mail o disco · 10 minuti
Come sai che ha funzionato: sui tre file riuscite a selezionare il testo solo sul primo. Gli altri due sono il test vero.
Strumento: claude.ai (piano con skill) o Claude Code · 5 minuti
Come sai che ha funzionato: alla richiesta «estrai la tabella da questo PDF» Claude non chiede che libreria usare. Parte e vi restituisce righe, non una lezione su pypdf.
Strumento: Claude con la skill attiva · 15 minuti
Devi estrarre dati da PDF per una piccola impresa italiana.
File: [nome del PDF allegato]
Tipo: [fattura di cortesia / preventivo / listino / DDT / contratto / altro]
Campi obbligatori, in quest'ordine:
1. data documento
2. numero documento
3. fornitore o cliente (ragione sociale)
4. partita IVA se c'è
5. imponibile
6. IVA
7. totale
8. scadenza pagamento se c'è
Regole:
- Se un campo non si legge, scrivi NON LETTO. Non inventare.
- Se il file è una scansione, dillo in cima e indica la qualità ( pulita / storta / illeggibile ).
- Restituisci una tabella e, sotto, tre righe di note: cosa hai letto bene, cosa è incerto, cosa va ricontrollato a mano.
- Non confondere il PDF di cortesia di una fattura elettronica con l'XML fiscale. Se sospetti che esista un XML, segnalalo.
- Valuta ogni riga: alta / media / bassa confidenza.
Alla fine proponi SOLO i tipi di documento che, su questo campione, merita automatizzare.
Come sai che ha funzionato: in tabella compare almeno un NON LETTO o una confidenza media. Se è tutto «alta» su una scansione brutta, non vi fidate: il modello sta coprendo i buchi.
Strumento: PDF originale + tabella · 10 minuti
Come sai che ha funzionato: avete un verdetto scritto (passa / non passa) per ciascuno dei tre tipi, non una sensazione.
Strumento: foglio o n8n · 20 minuti
Come sai che ha funzionato: in cartella ci sono due pile, non una. «Si può estrarre» e «si fa a mano». La pila unica è come prima, solo più veloce a sbagliare.
Il primo incidente è la scansione. La skill lo sa e passa dall’OCR: pagina resa come immagine, poi testo. Funziona su una fotocopia dritta. Su una foto di cellulare, col dito sul timbro e l’ombra del neon, confonde 8 e 3, 1 e 7. La correzione non è «un prompt migliore». È un file migliore, o la battitura dei campi che non potete sbagliare.
Il secondo è il modulo. Un PDF può sembrare un modulo e non avere campi compilabili: è solo un disegno di caselle. La skill, sul serio, vi obbliga a controllare prima se i campi esistono (ha persino uno script apposta). Se saltate quel controllo e chiedete «compilalo», ottenete un PDF che sembra riempito e i sistemi a valle lo leggono vuoto.
Il terzo è italiano al cento per cento: la fattura elettronica. Quella che vale per l’Agenzia delle Entrate è l’XML passato dal Sistema di Interscambio. Il PDF che vi arriva in mail è una copia di cortesia. Estrarre dal PDF ha senso per archivio e controllo rapido. Per la contabilità, chiedete l’XML o il tracciato del gestionale. Altrimenti state rileggendo la fotocopia e ignorando il file strutturato. È lo stesso principio che vale quando si parla di agenti AI in uno studio: si delega la ricopiatura, non la responsabilità del dato fiscale.
Il quarto è la memoria del modello. Su un PDF lungo, pypdf da solo è indicato come scelta debole; la skill preferisce pdfplumber o pdftotext, e sui file enormi lavora a pezzi. Se gli chiedete «riassumimi le 200 pagine» senza dire cosa vi serve, otterrete un riassunto vago e vi sembrerà che «Claude non funziona sui PDF». Funziona. Gli avete chiesto il compito sbagliato.
Il quinto è la licenza. La skill è ufficiale e proprietaria. Non va incollata in un repository aziendale «perché è su GitHub». Si usa nel perimetro Anthropic. Le librerie che chiama (pypdf, pdfplumber, reportlab, pypdfium2) sono invece open source, ciascuna con la sua licenza. Distinguere le due cose evita discussioni inutili col consulente informatico.
Tre condizioni, non negoziabili.
Uno: avete i file originali, non screenshot di screenshot. Due: sapete quali cinque campi vi servono, e li avete scritti. Tre: una persona con il mestiere (voi, il commercialista, l’amministrazione) accetta di fare il campione ogni volta che cambia il tipo di documento. Un nuovo fornitore con un layout nuovo è un tipo nuovo. Si ritesta.
Se manca la terza, non installate niente. Avete solo spostato l’errore dal foglio alla chat.
Non «adottare l’AI sui documenti». Fate una cosa sola: prendete i tre PDF di venerdì scorso, incollate il prompt, confrontate cinque righe. Segnate sul calendario se quel tipo di file è passato o no.
Il lunedì dopo, solo i tipi passati finiscono nella cartella da estrarre. Il resto resta il lavoro di sempre, senza la finzione che sia sparito.
Il ricopiare a mano ha un vantaggio che nessuno dice: quando sbagliate, vi accorgete perché vi fa male il polso. L’estrazione automatica è silenziosa. Per questo il campione non è un optional da consulenti. È l’unico freno che avete. Usatelo lunedì, su tre file, prima di promettere a qualcuno che «i PDF li fa l’AI».
No, se lavorate su claude.ai: caricate il file e chiedete la tabella o il riassunto. Il codice (pypdf, pdfplumber, OCR) lo esegue Claude quando serve. Programmare aiuta solo se volete incastrare l'estrazione in un flusso notturno, per esempio con n8n.
La skill in sé non si compra a parte. Pagate l'abbonamento a Claude che abilita le skill. Il repository ufficiale anthropics/skills ha superato le 170.000 stelle, ma la cartella pdf è a licenza proprietaria Anthropic: si usa dentro i servizi Anthropic, non si ridistribuisce.
Sul PDF di cortesia sì, con verifica. Il file fiscale vero è l'XML passato dallo SDI: quello va letto come XML, non come PDF. Se mandate al commercialista solo estrazioni da PDF, potete perdere campi obbligatori che nell'XML ci sono già strutturati.
La skill passa dall'OCR (immagine della pagina, poi testo). Su una scansione pulita recupera l'essenziale. Su una foto di cellulare storta, con ombre o timbri sopra i numeri, sbaglia cifre. Quei file si riallineano o si digitano a mano i campi critici.