Licensed to be used in conjunction with basebox, only.
// dokumente
Mit Bildern arbeiten
Kurzbeschreibung
Fotos, Screenshots und Scans: Was basebox aus Bildern liest, wo die Grenzen liegen und wie Sie Texterkennung gezielt einsetzen. Kurz gesagt: basebox liest den Text in einem Bild per Texterkennung (OCR) und macht ihn analysierbar wie ein Dokument.
Welche Bilder Sie hochladen können
| Format | Typisch für |
|---|---|
| JPG | Fotos, Handyaufnahmen von Dokumenten |
| PNG | Screenshots, Grafiken mit Text |
| TIFF | Scans aus Dokumentenscannern |
| HEIC | Fotos von Apple-Geräten |
| GIF | Einfache Grafiken |
| SVG, EMF | Vektorgrafiken und Windows-Metadateien |
Bilder laden Sie direkt als eigenständige Datei hoch – Sie müssen sie nicht erst in ein PDF oder Word-Dokument einbetten. Auch reine Bild-PDFs und Word-Dateien, die nur Bilder enthalten, werden per Texterkennung gelesen.
Was mit einem Bild passiert
- Sie laden das Bild in den Chat (Büroklammer oder Drag & Drop) oder in die Wissensbasis einer App.
- basebox erkennt den enthaltenen Text per OCR. Wo eine GPU verfügbar ist, läuft das beschleunigt; sonst automatisch auf der CPU.
- Der erkannte Text steht dem Assistenten zur Verfügung – Sie können ihn zusammenfassen, übersetzen, in eine Tabelle überführen oder Fragen dazu stellen.
Die Texterkennung arbeitet überall gleich: im Chat wie in der Wissensbasis.
Typische Einsatzfälle
- Fotografiertes Formular – „Übertrage die Angaben aus dem Formular in eine Tabelle."
- Screenshot einer Fehlermeldung – „Was bedeutet diese Meldung und was kann ich tun?"
- Gescannter Brief – „Fasse den Brief zusammen und nenne die Frist."
- Whiteboard-Foto – „Mache aus den Stichpunkten ein sauberes Protokoll." (Handschrift wird nur eingeschränkt erkannt.)
- Visitenkarte oder Beleg – „Extrahiere Name, Firma, Betrag und Datum."
Grenzen
basebox liest Text – es beschreibt keine Bilder
Ein Bild ohne Text – etwa ein Foto einer Landschaft oder ein Diagramm ohne Beschriftung – liefert keinen Inhalt, den basebox weiterverarbeiten kann. Erwarten Sie keine Bildbeschreibung.
Weitere Grenzen:
- Handschrift wird nur eingeschränkt erkannt; gedruckter Text funktioniert deutlich zuverlässiger.
- Schlechte Qualität – unscharf, schräg, dunkel, kleine Schrift – verschlechtert das Ergebnis.
- Mehrsprachige Bilder funktionieren, gemischte Schriftsysteme können Fehler erzeugen.
Tipps für gute Erkennung
- Fotografieren Sie gerade von oben, bei gleichmäßigem Licht, ohne Schatten.
- Nutzen Sie beim Scannen 300 dpi und Schwarz-Weiß oder Graustufen für Textdokumente.
- Schneiden Sie Ränder und Hintergrund weg; das Dokument sollte das Bild füllen.
- Bei mehreren Seiten: lieber ein mehrseitiges PDF als viele Einzelbilder – dann bleibt die Reihenfolge erhalten.
Hinweise
Hinweis
- Im Chat gilt auch für Bilder das Limit von 10 MB pro Datei. Handyfotos sind oft größer als nötig – eine Verkleinerung schadet der Texterkennung selten.
- Videos werden nicht verarbeitet. Brauchen Sie den Ton, extrahieren Sie die Audiospur; siehe Speech-to-Text nutzen.
- Prüfen Sie erkannte Zahlen – 0 und O, 1 und l sind klassische OCR-Fehler.
Häufige Fragen
Kann ich ein Bild direkt in den Chat einfügen (Strg+V)? Laden Sie Bilder über die Büroklammer oder per Drag & Drop hoch.
Warum kommt bei meinem Bild nichts zurück? Wahrscheinlich enthält es keinen erkennbaren Text, oder die Qualität ist zu schlecht. Prüfen Sie, ob Sie den Text selbst gut lesen können.
Werden Bilder in einer Wissensbasis dauerhaft gespeichert? Ja, wie jede andere Datei der App – bis Sie sie entfernen. Achten Sie darauf, nur Bilder hochzuladen, deren Inhalt alle Nutzer der App sehen dürfen.
Benötigen Sie Hilfe? Support kontaktieren