📹 Video uskoro
Nikola
Word, PDF i dokumenta — čitanje nestrukturisanih podataka
Nikola · MercatoMaster Akademija

Word, PDF i dokumenta — čitanje nestrukturisanih podataka

⏱️ 13 min 📖 Lekcija 3 od 5

Kad podaci nisu u tabeli

Nije sve u Excelu. Mnogi mali biznis vlasnici vode kontakte u Word dokumentima, dobijaju PDF kataloge s kontakt podacima ili imaju stare ponude s email adresama klijenata.

Nikola čita i ove formate — ali treba znati šta možete očekivati.


Word dokumenti (.docx)

Nikola ume da čita:

Tabele u Wordu:
Ako su kontakti u tabeli (čak i nepravilnoj), Nikola ih čita skoro savršeno.

Tekst u telu dokumenta:
Nikola prepoznaje pattern: "Kontakt: Petar Petrović, pp@firma.rs, 064 111 222"
Preciznost je niža nego kod tabela — oko 85%.

Lista u Wordu:

• Marko Marković | marko@ab.rs | AB Consulting
• Jovana Jovanović | jovana@cd.rs | CD Trade

Nikola čita liste dobro ako je format konzistentan unutar dokumenta.


PDF fajlovi

PDF je najizazovniji format jer PDF ne čuva strukturu podataka — čuva samo vizuelni izgled.

Digitalni PDF (kreiran u softveru):
Nikola može da čita tekst direktno. Preciznost: 80–90% za tabelarni sadržaj.

Skenirani PDF (fotografija dokumenta):
Nikola koristi OCR (optičko prepoznavanje karaktera). Preciznost zavisi od kvaliteta skeniranja:
- Dobar sken (300 DPI): 90%+
- Loš sken (crno-belo, nagnut): 60–70%

Preporuka: Za skenirane PDFove, uvek proverite preview uvoza pre potvrde.


Best practice za Word i PDF uvoz

  1. Pre uvoza — otvorite fajl i proverite da li su kontakti vizuelno jasno organizovani
  2. Pokrenite uvoz — Nikola pokazuje preview svih prepoznatih kontakata
  3. Proverite uzorak — prođite kroz prvih 10 kontakata ručno
  4. Odobrite ili korigujte — svaki kontakt možete editovati pre finalnog uvoza

Šta Nikola NE može da čita iz PDF-a

  • Slike u PDF-u (logo sa brojem telefona)
  • Tekst unutar slike umetnute u PDF
  • Zaštićeni PDF-ovi (lozinkom)
  • Ručno pisani dokumenti (osim uz OCR proširenje)
🎯 Proverite znanje
4 pitanja — izaberite tačan odgovor za svako
1. Koji format Nikola čita sa najvišom preciznošću?
✓ Tačno! Excel je strukturisani format i Nikola ga čita sa najvećom preciznošću. PDF i Word tekst su manje precizni.
✗ Netačno. Excel je strukturisani format i Nikola ga čita sa najvećom preciznošću. PDF i Word tekst su manje precizni.
2. Šta je OCR u kontekstu PDF uvoza?
✓ Tačno! OCR (Optical Character Recognition) je tehnologija kojom Nikola pretvara sliku teksta iz skeniranog PDF-a u čitljiv tekst.
✗ Netačno. OCR (Optical Character Recognition) je tehnologija kojom Nikola pretvara sliku teksta iz skeniranog PDF-a u čitljiv tekst.
3. Koji faktor NAJVIŠE utiče na preciznost skeniranog PDF-a?
✓ Tačno! Dobar sken (300 DPI+) daje 90%+ preciznost. Loš sken može pasti na 60–70%.
✗ Netačno. Dobar sken (300 DPI+) daje 90%+ preciznost. Loš sken može pasti na 60–70%.
4. Šta Nikola NE može da pročita iz PDF-a?
✓ Tačno! Nikola ne može čitati tekst koji je unutar slike umetnute u PDF — samo direktni tekstualni sadržaj.
✗ Netačno. Nikola ne može čitati tekst koji je unutar slike umetnute u PDF — samo direktni tekstualni sadržaj.
Jelena