OCR PDF
Käytä tätä työkalua suoraan selaimessasi paikallisella WebAssembly-käsittelyllä - tiedostosi pysyvät laitteellasi, ellei nimenomaisesti valitse tekoälyominaisuutta, joka lähettää poimitun tekstin API:llemme. JoyPDF tarjoaa ilmaisen tason keskeisiin PDF-tehtäviin ja valinnaisen Premium-suunnitelman kehittyneisiin rajoihin ja tekoälypohjaisiin työnkulkuihin.
OCR PDF
Poimi haettava teksti skannatuista asiakirjoista.
Tietoa tästä työkalusta
Muuta skannatut PDF:t ja kuvapohjaiset dokumentit haettaviksi, kopioitaviksi tiedostoiksi – tunnista teksti selaimessasi Tesseract.js:llä lataamatta sivuja pilvi-OCR-palveluun. Valitse kielet, aja tunnistus paikallisesti ja lataa PDF piilotetulla tekstikerroksella, joka vastaa näkyvää skannausta. Ilmainen, ei tiliä. Välttämätön arkistosopimuksille, viranomaislomakkeille ja tutkimus-PDF:ille, joissa tarvitset Ctrl+F:n, kopioi-liitä-toiminnon tai myöhemmän PDF-Word-vaiheen.
What you get
- Tulos: PDF, jossa on näkymätön tekstikerros jokaisella sivulla – haku ja kopiointi toimivat Acrobatissa, Previewissa ja selaimissa.
- Moottori: Tesseract LSTM ajetaan paikallisesti WebAssemblyn kautta – ei kolmannen osapuolen OCR-API:a oletuksena.
- Kielet: monikieliset paketit yhdistetään +-merkillä – tarkkuus riippuu kunkin kirjoituksen koulutusdatasta.
- Visuaalinen: sivun ulkoasu pysyy skannauksena; OCR ei uudelleenlataa tekstiä tai siivoa vinoja marginaaleja automaattisesti.
- Käsiala: kursiivi ja allekirjoitukset epäonnistuvat yleensä tai ovat osittaisia – konekirjoitettu teksti toimii parhaiten.
- Rajat: suuret skannaukset 300 dpi:llä vievät aikaa vanhemmilla kannettavilla; hyvin haalea teksti tai runsas kohina vähentää tarkkuutta.
Milloin käyttää
- Vanhan paperiarkiston tekeminen haettavaksi lähettämättä massoja ulkoiselle OCR-toimittajalle.
- Skannattujen sopimusten valmistelu PDF-Word-muunnokseen, kun syntyperäistä digitaalista tekstiä ei ole.
- Kopioi-liitä-toiminnon mahdollistaminen viranomais-PDF:istä, jotka teknisesti ovat kuvia.
- Kokouspakettien indeksointi tulosteista skannattuna sisäisiin tietopankkeihin.
Why JoyPDF for this
Pilvi-OCR-palvelut lataavat jokaisen sivun – mukaan lukien allekirjoitukset, tilinumerot ja luokitellut kappaleet – tunnistamaan tekstiä etänä. JoyPDF OCR ajetaan kokonaan selaimessasi: pikselit ja tunnistetut merkkijonot pysyvät laitteella käsittelyn aikana. Valitset kielet eksplisiittisesti sen sijaan, että palvelin arvaisi. Se sopii GDPR:ään, asianajajan salassapitovelvollisuuteen ja lähes ilmaväliin eristettyihin workfloweihin, joissa ulospäin menevä dokumenttisiirto on kielletty.
Näin käytät
- 1Lisää skannattu PDFPudota tiedosto tai valitse se laitteeltasi. Sivut latautuvat paikallisesti – ei palvelinpuolen OCR-jonoa.
- 2Valitse OCR-kieletValitse tunnistuskielet – esim. englanti, puola tai yhdistetty eng+pol kaksikielisille skannauksille.
- 3Suorita tunnistusJoyPDF käsittelee jokaisen sivun laitteellasi; edistyminen näkyy sivukohtaisesti, koska OCR on CPU-intensiivistä.
- 4Lataa haettava PDFTallenna OCR-käsitelty tiedosto – visuaalisesti samanlainen kuin skannaus, mutta valittavalla, haettavalla tekstillä alla.