Omnipage 16 - Hilfe - Datensätze

Hi all,

ich befinde mich momentan in der Ausbildung zum Fachinformatiker und habe vor einigen Wochen ein Projekt zugeteilt bekommen.

Ich soll über 1000 Datenblätter einscannen, welche eine Auflistung unzähliger Schallplatten - Interpreten und deren Titel enthalten.

Nun soll ich mit Hilfe von Omnipage 16 diese einlesen und das Verfahren automatisieren!
Anders gesagt, ich soll eine Vorlage erschaffen die auf alle *.pdf Dateien passt und nachher geordnet in Excel ausgegeben werden.
/Digitalisieren der Datenblätter/

Es soll später eine riesige Datenbank entstehen aus der per Suche eines Titels oder Interpreten alle Informationen ausgegeben werden.

(Interpret, Titel, Plattenfirma, Preis…)

Mein Frage:

Wie kann ich ein einheitliches Scanverfahren einleiten, bzw. eine Maske erstellen die für alle Seiten übernommen wird?
Ein Beispiel der Seiten ist durch einen Klick auf folgenden Link zu erhalten.

http://home.arcor.de/mr.sing/seite1.pdf

Kann ich irgendwo Regeln festlegen, die besagen, dass z.B. nach einem * ein Songtitel kommt, nach einer Klammer Zusatzinformationen etc. ?

Ich freue mich über jede Antwort da ich mittlerweile leicht verzweifle.

Lieben Dank.

Jelly

Hallo,

Anders gesagt, ich soll eine Vorlage erschaffen die auf alle
*.pdf Dateien passt und nachher geordnet in Excel ausgegeben
werden.

Mit einer Vorlage wirst Du da nicht viel erreichen. Du kannst höchstens den Scanbereich so einstellen, dass zumindest schon mal die Spaltenköpfe raus sind, und die Spalten separiert werden. Eine rahmenorientierte Formularerfassung, wie sie z.B. FormReader bietet, bringt hier nichts, weil die fixe Feldgrößen und Feldanordnungen voraussetzt (z.b. wie auf einem Überweisungsformular). Genau die hast Du hier aber nicht. Teilweise wird ein-, teilweise mehrspaltig gearbeitet, es gibt mit Punkten aufgefüllte Felder, es wird proportionale Schrift verwendet, …

Einzig mir denkbarer Ansatz ist ein Parser, der den als Fließtext von der OCR gelieferten langen Riemen dann anhand einzelner Zeichen passend zerhackt. Ich kenne jetzt Omnipage nicht, und weiß daher nicht, ob dort bereits ein solches Parsen auf textlicher Ebene vorgesehen ist. Wenn nein, solltest Du ein kleines Programm schreiben, was auch z.B. ein Macro in Word sein könnte.

Wenn Du dann erst einmal eines saubere CSV-Datei hast, ist es ein Leichtes die in eine DB zu importieren, und darauf dann Abfragen über nette Eingabemasken zu ermöglichen.

Gruß vom Wiz