YesPDF logosu
YesPDF.Ocr · Mühendislik Makalesi

Türkçe Taranmış Belgeler için Yüksek Doğruluklu OCR ve Düzenlenebilir PDF Üretimi

Kamu ihale evrakları başta olmak üzere Türkçe resmi belgelerin, mühür ve imzaları koruyarak aranabilir ve gerçek anlamda düzenlenebilir PDF'e dönüştürülmesi.

Yes Bilişim Teknolojileri A.Ş. Temmuz 2026 yespdf.com.tr
< %0.5Karakter hata oranı (CER)
< %2Kelime hata oranı (WER)
İ Ğ Ş ı ğ şTam Türkçe karakter desteği
%100Mühür & imza koruması

Kamu kurumları, belediyeler ve özel sektör kuruluşları her yıl milyonlarca sayfalık basılı evrak üretiyor. Bu evraklar taranıp arşivleniyor — ama ortaya çıkan PDF'ler aslında birer fotoğraf: içinde arama yapamaz, metni kopyalayamaz, tek bir kelimeyi bile düzenleyemezsiniz.

BÖLÜM 01Giriş ve Hedef Belgeler

Genel amaçlı OCR çözümleri Türkçe'nin diakritik yapısı, resmi belge formatları ve imza/mühür içeriği karşısında yetersiz kalıyor. Bu çalışma tam olarak bu boşluğu doldurmak için tasarlandı. Temel hedef netti: ticari bir ürün olan ABBYY FineReader'ın ClearScan teknolojisi seviyesinde, ancak lisans açısından serbest ve yerli kaynaklarla üretilebilen bir çözüm.

Sistem öncelikli olarak şu belge tipleri için optimize edildi:

Bu belgelerin ortak paydası: serif (Times benzeri) font kullanımı, standart resmi format, mühür/kaşe/imza içermesi ve yoğun Türkçe karakter barındırması.

BÖLÜM 02Teknik Yaklaşım ve İşlem Hattı

Sistem tasarlanırken üç temel ilke benimsendi: Lisans güvenliği (tüm bileşenler Apache-2.0 veya MIT; AGPL/GPL bağımlılık sıfır), modülerlik (her katman bağımsız test edilebilir) ve çoklu platform (aynı işlem hattı hem Windows masaüstünde C# ile hem web sunucusunda Python ile çalışır).

Bir taranmış PDF'in düzenlenebilir PDF'e dönüşümü yedi aşamadan geçer:

Görüntü hazırlığı

Eğiklik düzeltme (deskew) ve gürültü temizleme. Bu aşama yalnızca tanıma kalitesini etkiler; orijinal görüntü daima korunur.

Bölge tespiti

Derin öğrenme modeli (PP-DocLayout) sayfayı metin, tablo, mühür, resim ve başlık bölgelerine ayırır. Mühür ve imza bölgeleri tanımadan hariç tutularak halüsinasyon metinler engellenir.

Karakter tanıma

Metin bölgeleri Tesseract Türkçe LSTM modeli ile tanınır. Sayfa bazında paralel çalışır ve çok çekirdekli işlemcilerden tam verim alır.

Yapısal analiz

Kelimeler satırlara, satırlar paragraf ve başlıklara gruplanır. Okuma sırası belirlenir; içindekiler tablolarındaki nokta dizileri otomatik filtrelenir.

Font eşleştirme

Belgenin serif/sans-serif karakteri görüntü analiziyle tahmin edilir. Kalın ve italik satırlar kelime geometrisinden çıkarılır.

Düzenlenebilir katman üretimi

Taranmış metin beyaz katmanla gizlenir; üzerine eşleşen fontla tanınan metin yeniden yazılır. Kullanıcı ContentEdit ile metni seçip değiştirebilir. Mühür ve imza bölgelerine dokunulmaz.

Damgalama

Üretilen PDF meta veri damgasıyla işaretlenir; belgenin daha önce işlenip işlenmediği anında anlaşılır.

BÖLÜM 03Türkçe Odaklı İyileştirmeler

Karakter kodlama sorunu

İ, Ğ, Ş, ğ, ı, ş, Ç, Ö, Ü karakterleri standart Windows-1252 karakter setinde bulunmaz. Basit font şeması kullanan PDF üreticileri bu karakterleri yanlış baytlara eşler ve ortaya okunamaz metin çıkar.

Çözüm: Üretim hattında daima CID/Type0 font mimarisi (Identity-H) kullanılır. Her glif için iki baytlık Unicode eşlemesi — Türkçe karakterlerin tümü doğru biçimde, sıfır kayıpla üretilir.

Yazım düzeltme

Türkçe sözlük ve karışıklık matrisi kullanılarak tanıma sonrası düzeltme uygulanır. Düzeltme yıkıcı değildir: sayılar, yabancı teknik terimler ve özel isimler korunur.

İçindekiler ve leader temizliği

Resmi belgelerde içindekiler tabloları sayfa numarasına nokta dizileri (........) ile bağlanır. OCR motorları bu dizileri yanlışlıkla harflere çevirip cümle içine çöp metin karıştırabilir. Sistem bu nokta dizilerini hem görüntü seviyesinde hem tanıma sonrası seviyede filtreler.

BÖLÜM 04İmza ve Mühür Koruması

Resmi belgelerin en kritik görsel öğeleri imzalar, mühürler ve kaşelerdir. OCR sistemlerinin en yaygın hatası, bu bölgelerdeki el yazısını ve dairesel yapıları anlamsız metne çevirmesidir. Sistem bunu iki katmanla çözer:

Belirlenen bölgeler tanıma motoruna "yok say" olarak iletilir: bu alanlarda hiçbir karakter tanıması yapılmaz, düzenlenebilir çıktıda beyazlatma uygulanmaz. İmza ve mühürler orijinal görüntü kalitesiyle korunur.

BÖLÜM 05Belge Yapısı Analizi

Tablo yapı tanıma: DETR mimarisine dayanan Table Transformer (TATR) modeliyle tabloların satır-sütun yapısı tanınır; içerik hücre bazında düzenlenebilir hale gelir.

Okuma sırası: İki sütunlu belgelerde okuma sırası otomatik belirlenir. Her sayfada tekrarlayan üst/alt bilgiler (kurum adı, sayfa numarası) belge geneli istatistikle tespit edilip içerikten ayrılır.

BÖLÜM 06Sonuçlar ve Performans

Belge TipiSayfaYaklaşık SüreKalite
İmza sirküsü1~13 saniyeYüksek
İmzalı şartname8~100 saniyeYüksek
Teknik şartname10~150 saniyeYüksek

Tüm belge tiplerinde karakter hata oranı (CER) %0.5'in, kelime hata oranı (WER) %2'nin altında ölçüldü. Türkçe diakritik karakterler eksiksiz üretildi; mühür, imza ve resimler görsel olarak korundu; ContentEdit ile metin düzenleme başarıyla doğrulandı. OCR motoru kendi içinde paralel iş parçacıkları kullanır; sayfa bazlı ek paralelleştirme ile 16 çekirdekli bir sunucuda büyük belgeler dakikalar içinde işlenir.

ÜRETİME
HAZIR
CER < %0.5 · WER < %2
YesPDF.Ocr · 2026

BÖLÜM 07Teknolojiler ve Lisans Güvenliği

BileşenRolüLisans
Apryse (PDFTron) Server SDKPDF işleme, OCR altyapısıOEM Lisansı
Tesseract (Türkçe LSTM)Karakter tanımaApache-2.0
PP-DocLayoutBelge düzeni analiziApache-2.0
Table TransformerTablo yapı tanımaMIT
Skia / SkiaSharpGörüntü işlemeMIT
.NET 8 / PythonUygulama platformuMIT / PSF
Kurumsal dağıtıma hazır: AGPL veya GPL kısıtlı hiçbir bağımlılık yok. Banka ve kamu kurumlarına gönül rahatlığıyla dağıtılabilir. On-Prem senaryosunda veri kurum ağının dışına asla çıkmaz.

Dağıtım modelleri

Sistem üç senaryoda aynı çekirdeği paylaşır: Masaüstü (Windows) — mevcut PDF uygulamasının içerik düzenleme özelliğiyle entegre komut satırı uygulaması; Kurum içi sunucu (On-Prem) — REST API ile entegre, Windows/Linux üzerinde çalışan, verisi dışarı çıkmayan web servisi; Bulut (Online) — çoklu kiracı desteğiyle ölçeklenebilir dağıtım.

BÖLÜM 08Vizyon ve Sonraki Adımlar

Mevcut sistem üretime hazır düzenlenebilir PDF üretme yeteneğine sahip. Vizyonumuz, belge yapısının daha derin semantik bir temsilini (Intermediate Representation) kurmak: sadece metni değil, başlık hiyerarşisini, tablo yapısını, imza bloğunu ve alt bilgiyi taşıyan bir ara format.

Bu ara format; Word, HTML, erişilebilir PDF/UA ve yapılandırılmış veri çıktılarının tek kaynağı olacak. Bu, ABBYY ClearScan'in ötesine geçerek belgeyi bir görüntü değil, bir bilgi yapısı olarak ele almak anlamına geliyor.

YesPDF.Ocr — Türkçe taranmış belgeler için yüksek doğruluklu OCR
YesPDF.Ocr — Türkçe resmi belgeler için üretime hazır OCR ve düzenlenebilir PDF çözümü