Word, PDF i dokumenta — čitanje nestrukturisanih podataka
Kad podaci nisu u tabeli
Nije sve u Excelu. Mnogi mali biznis vlasnici vode kontakte u Word dokumentima, dobijaju PDF kataloge s kontakt podacima ili imaju stare ponude s email adresama klijenata.
Nikola čita i ove formate — ali treba znati šta možete očekivati.
Word dokumenti (.docx)
Nikola ume da čita:
Tabele u Wordu:
Ako su kontakti u tabeli (čak i nepravilnoj), Nikola ih čita skoro savršeno.
Tekst u telu dokumenta:
Nikola prepoznaje pattern: "Kontakt: Petar Petrović, pp@firma.rs, 064 111 222"
Preciznost je niža nego kod tabela — oko 85%.
Lista u Wordu:
• Marko Marković | marko@ab.rs | AB Consulting
• Jovana Jovanović | jovana@cd.rs | CD Trade
Nikola čita liste dobro ako je format konzistentan unutar dokumenta.
PDF fajlovi
PDF je najizazovniji format jer PDF ne čuva strukturu podataka — čuva samo vizuelni izgled.
Digitalni PDF (kreiran u softveru):
Nikola može da čita tekst direktno. Preciznost: 80–90% za tabelarni sadržaj.
Skenirani PDF (fotografija dokumenta):
Nikola koristi OCR (optičko prepoznavanje karaktera). Preciznost zavisi od kvaliteta skeniranja:
- Dobar sken (300 DPI): 90%+
- Loš sken (crno-belo, nagnut): 60–70%
Preporuka: Za skenirane PDFove, uvek proverite preview uvoza pre potvrde.
Best practice za Word i PDF uvoz
- Pre uvoza — otvorite fajl i proverite da li su kontakti vizuelno jasno organizovani
- Pokrenite uvoz — Nikola pokazuje preview svih prepoznatih kontakata
- Proverite uzorak — prođite kroz prvih 10 kontakata ručno
- Odobrite ili korigujte — svaki kontakt možete editovati pre finalnog uvoza
Šta Nikola NE može da čita iz PDF-a
- Slike u PDF-u (logo sa brojem telefona)
- Tekst unutar slike umetnute u PDF
- Zaštićeni PDF-ovi (lozinkom)
- Ručno pisani dokumenti (osim uz OCR proširenje)