Kamu kurumları, belediyeler ve özel sektör kuruluşları her yıl milyonlarca sayfalık basılı evrak üretiyor. Bu evraklar taranıp arşivleniyor — ama ortaya çıkan PDF'ler aslında birer fotoğraf: içinde arama yapamaz, metni kopyalayamaz, tek bir kelimeyi bile düzenleyemezsiniz.
BÖLÜM 01Giriş ve Hedef Belgeler
Genel amaçlı OCR çözümleri Türkçe'nin diakritik yapısı, resmi belge formatları ve imza/mühür içeriği karşısında yetersiz kalıyor. Bu çalışma tam olarak bu boşluğu doldurmak için tasarlandı. Temel hedef netti: ticari bir ürün olan ABBYY FineReader'ın ClearScan teknolojisi seviyesinde, ancak lisans açısından serbest ve yerli kaynaklarla üretilebilen bir çözüm.
Sistem öncelikli olarak şu belge tipleri için optimize edildi:
- Kamu ihale şartnameleri ve teknik şartnameler
- Resmi yazışmalar ve kurul kararları
- İmza sirküleri ve ticaret sicil evrakları
- Sözleşmeler, protokoller, resmi formlar ve tutanaklar
Bu belgelerin ortak paydası: serif (Times benzeri) font kullanımı, standart resmi format, mühür/kaşe/imza içermesi ve yoğun Türkçe karakter barındırması.
BÖLÜM 02Teknik Yaklaşım ve İşlem Hattı
Sistem tasarlanırken üç temel ilke benimsendi: Lisans güvenliği (tüm bileşenler Apache-2.0 veya MIT; AGPL/GPL bağımlılık sıfır), modülerlik (her katman bağımsız test edilebilir) ve çoklu platform (aynı işlem hattı hem Windows masaüstünde C# ile hem web sunucusunda Python ile çalışır).
Bir taranmış PDF'in düzenlenebilir PDF'e dönüşümü yedi aşamadan geçer:
Eğiklik düzeltme (deskew) ve gürültü temizleme. Bu aşama yalnızca tanıma kalitesini etkiler; orijinal görüntü daima korunur.
Derin öğrenme modeli (PP-DocLayout) sayfayı metin, tablo, mühür, resim ve başlık bölgelerine ayırır. Mühür ve imza bölgeleri tanımadan hariç tutularak halüsinasyon metinler engellenir.
Metin bölgeleri Tesseract Türkçe LSTM modeli ile tanınır. Sayfa bazında paralel çalışır ve çok çekirdekli işlemcilerden tam verim alır.
Kelimeler satırlara, satırlar paragraf ve başlıklara gruplanır. Okuma sırası belirlenir; içindekiler tablolarındaki nokta dizileri otomatik filtrelenir.
Belgenin serif/sans-serif karakteri görüntü analiziyle tahmin edilir. Kalın ve italik satırlar kelime geometrisinden çıkarılır.
Taranmış metin beyaz katmanla gizlenir; üzerine eşleşen fontla tanınan metin yeniden yazılır. Kullanıcı ContentEdit ile metni seçip değiştirebilir. Mühür ve imza bölgelerine dokunulmaz.
Üretilen PDF meta veri damgasıyla işaretlenir; belgenin daha önce işlenip işlenmediği anında anlaşılır.
BÖLÜM 03Türkçe Odaklı İyileştirmeler
Karakter kodlama sorunu
İ, Ğ, Ş, ğ, ı, ş, Ç, Ö, Ü karakterleri standart Windows-1252 karakter setinde bulunmaz. Basit font şeması kullanan PDF üreticileri bu karakterleri yanlış baytlara eşler ve ortaya okunamaz metin çıkar.
Yazım düzeltme
Türkçe sözlük ve karışıklık matrisi kullanılarak tanıma sonrası düzeltme uygulanır. Düzeltme yıkıcı değildir: sayılar, yabancı teknik terimler ve özel isimler korunur.
İçindekiler ve leader temizliği
Resmi belgelerde içindekiler tabloları sayfa numarasına nokta dizileri (........) ile bağlanır. OCR motorları bu dizileri yanlışlıkla harflere çevirip cümle içine çöp metin karıştırabilir. Sistem bu nokta dizilerini hem görüntü seviyesinde hem tanıma sonrası seviyede filtreler.
BÖLÜM 04İmza ve Mühür Koruması
Resmi belgelerin en kritik görsel öğeleri imzalar, mühürler ve kaşelerdir. OCR sistemlerinin en yaygın hatası, bu bölgelerdeki el yazısını ve dairesel yapıları anlamsız metne çevirmesidir. Sistem bunu iki katmanla çözer:
- Katman 1: PP-DocLayout_plus-L (20 sınıflı) derin öğrenme modeli mühür ve resim bölgelerini belirler.
- Katman 2: Görüntü işleme ile büyük koyu blob analizi, ilk katmanın kaçırdığı seyrek imzaları yakalar.
Belirlenen bölgeler tanıma motoruna "yok say" olarak iletilir: bu alanlarda hiçbir karakter tanıması yapılmaz, düzenlenebilir çıktıda beyazlatma uygulanmaz. İmza ve mühürler orijinal görüntü kalitesiyle korunur.
BÖLÜM 05Belge Yapısı Analizi
Tablo yapı tanıma: DETR mimarisine dayanan Table Transformer (TATR) modeliyle tabloların satır-sütun yapısı tanınır; içerik hücre bazında düzenlenebilir hale gelir.
Okuma sırası: İki sütunlu belgelerde okuma sırası otomatik belirlenir. Her sayfada tekrarlayan üst/alt bilgiler (kurum adı, sayfa numarası) belge geneli istatistikle tespit edilip içerikten ayrılır.
BÖLÜM 06Sonuçlar ve Performans
| Belge Tipi | Sayfa | Yaklaşık Süre | Kalite |
|---|---|---|---|
| İmza sirküsü | 1 | ~13 saniye | Yüksek |
| İmzalı şartname | 8 | ~100 saniye | Yüksek |
| Teknik şartname | 10 | ~150 saniye | Yüksek |
Tüm belge tiplerinde karakter hata oranı (CER) %0.5'in, kelime hata oranı (WER) %2'nin altında ölçüldü. Türkçe diakritik karakterler eksiksiz üretildi; mühür, imza ve resimler görsel olarak korundu; ContentEdit ile metin düzenleme başarıyla doğrulandı. OCR motoru kendi içinde paralel iş parçacıkları kullanır; sayfa bazlı ek paralelleştirme ile 16 çekirdekli bir sunucuda büyük belgeler dakikalar içinde işlenir.
HAZIR CER < %0.5 · WER < %2
YesPDF.Ocr · 2026
BÖLÜM 07Teknolojiler ve Lisans Güvenliği
| Bileşen | Rolü | Lisans |
|---|---|---|
| Apryse (PDFTron) Server SDK | PDF işleme, OCR altyapısı | OEM Lisansı |
| Tesseract (Türkçe LSTM) | Karakter tanıma | Apache-2.0 |
| PP-DocLayout | Belge düzeni analizi | Apache-2.0 |
| Table Transformer | Tablo yapı tanıma | MIT |
| Skia / SkiaSharp | Görüntü işleme | MIT |
| .NET 8 / Python | Uygulama platformu | MIT / PSF |
Dağıtım modelleri
Sistem üç senaryoda aynı çekirdeği paylaşır: Masaüstü (Windows) — mevcut PDF uygulamasının içerik düzenleme özelliğiyle entegre komut satırı uygulaması; Kurum içi sunucu (On-Prem) — REST API ile entegre, Windows/Linux üzerinde çalışan, verisi dışarı çıkmayan web servisi; Bulut (Online) — çoklu kiracı desteğiyle ölçeklenebilir dağıtım.
BÖLÜM 08Vizyon ve Sonraki Adımlar
Mevcut sistem üretime hazır düzenlenebilir PDF üretme yeteneğine sahip. Vizyonumuz, belge yapısının daha derin semantik bir temsilini (Intermediate Representation) kurmak: sadece metni değil, başlık hiyerarşisini, tablo yapısını, imza bloğunu ve alt bilgiyi taşıyan bir ara format.
Bu ara format; Word, HTML, erişilebilir PDF/UA ve yapılandırılmış veri çıktılarının tek kaynağı olacak. Bu, ABBYY ClearScan'in ötesine geçerek belgeyi bir görüntü değil, bir bilgi yapısı olarak ele almak anlamına geliyor.