ja ich denke es reicht aus.
Warum
weil das Model nicht die Aufgabe bekommt das gesammte OCR zu übernehmen.
Folgende verarbeitungskette habe ich mir überlegt:
Digitale PDF → pdfplumber → Regex → fertig (kein OCR, kein LLM)
Scan/Foto → Tesseract → Rohtext → ollama (wenn verfügbar) → strukturiertes JSON
Fallback → Rohtext → Regex → Rest manuell ausfüllen