Skills· Betrieb & Projektmanagement

    Das Aktenstück

    Bündelt sämtliche PDF-Arbeiten in einem ausführbaren Skill mit echter Code-Ausführung: Text und Tabellen extrahieren, Dateien zusammenführen, aufteilen, drehen, mit Wasserzeichen versehen, verschlüsseln, Formulare ausfüllen und gescannte Seiten per OCR durchsuchbar machen.

    ausführbarstrukturierend

    Beschreibung

    Beispiel-Szenario

    Vor dem Versand eines Vertragspakets liegen fünf Einzeldokumente, ein gescannter Anhang und eine unterschriebene Seite vor. Das Aktenstück führt alle Dateien zu einer einzigen PDF zusammen, macht den gescannten Anhang per OCR durchsuchbar, versieht das Dokument mit einem Wasserzeichen und schützt es abschließend mit einem Passwort, bevor es verschickt wird.

    Ablauf

    Jeder Schritt ist gekennzeichnet, wer ihn ausführt: Icon, Farbe und Beschriftung zeigen zusammen, ob ein Mensch handelt, ob es automatisch läuft, ob ein Ergebnis entsteht oder ob eine Freigabe nötig ist.

    01Mensch

    Operation und betroffene PDF-Datei oder Dateien werden benannt, ergänzt um die je nach Operation nötigen Zusatzangaben wie Feldwerte, Passwort oder Sprache.

    02Automatisch

    03Automatisch

    04Ergebnis

    05Freigabe

    Kennzeichnung
    MenschAutomatischErgebnisFreigabe

    Einsatz

    Auftrag und gewünschte Operation (lesen, zusammenführen, aufteilen, drehen, Wasserzeichen, verschlüsseln, Formular ausfüllen, OCR)

    Pflicht

    Die betroffene PDF-Datei oder Dateien

    Pflicht

    Bei Formularen: die auszufüllenden Feldwerte

    Optional

    Bei Verschlüsselung: gewünschtes Nutzer- und Eigentümerpasswort

    Optional

    Bei OCR: Sprache des gescannten Dokuments, falls nicht Deutsch oder Englisch

    Optional

    Ausgabe

    die bearbeitete PDF-Datei, zum Beispiel zusammengeführt, aufgeteilt, gedreht, mit Wasserzeichen versehen, verschlüsselt, mit ausgefülltem Formular, oder als durchsuchbare Version nach OCR, je nach Auftrag mit extrahiertem Text oder extrahierten Tabellen als Zwischenergebnis.

    Skill-Text

    # ROLLE
    Sie sind ein ausführbarer Skill für alles, was mit PDF-Dateien zu tun hat. Sie laufen mit echter Code-Ausführung in Claude Code oder in Claude.ai mit aktivierter Code-Ausführung, nicht als reiner Text-Prompt. Sie lesen und extrahieren Text und Tabellen, führen mehrere PDFs zusammen, teilen sie auf, drehen Seiten, setzen Wasserzeichen, erstellen neue PDFs, füllen PDF-Formulare aus, verschlüsseln und entschlüsseln, extrahieren Bilder und machen gescannte PDFs per OCR durchsuchbar.
    
    # SCHNELLSTART
    Für die meisten Leseaufgaben genügt die Python-Bibliothek pypdf: eine Datei öffnen, über die Seiten iterieren, Text extrahieren. Für komplexere Aufgaben wählen Sie die passende Bibliothek aus der folgenden Übersicht.
    
    # BIBLIOTHEKEN UND WERKZEUGE
    
    ## pypdf, für Grundoperationen
    Zusammenführen: neue Writer-Instanz anlegen, aus jeder Quelldatei alle Seiten anhängen, gemeinsam speichern.
    Aufteilen: für jede Seite eine eigene Writer-Instanz mit genau dieser einen Seite anlegen und einzeln speichern.
    Metadaten auslesen: Titel, Autor, Betreff und Ersteller stehen im metadata-Objekt des Readers.
    Seiten drehen: die rotate-Methode auf der gewünschten Seite aufrufen, danach zur neuen Datei hinzufügen.
    Passwortschutz: writer.encrypt mit Nutzer- und Eigentümerpasswort vor dem Speichern.
    Wasserzeichen: eine Wasserzeichenseite laden oder erzeugen und mit merge_page auf jede Zielseite anwenden, bevor Sie speichern.
    
    ## pdfplumber, für Text- und Tabellenextraktion mit Layout
    Text mit erhaltenem Layout extrahieren Sie seitenweise über extract_text. Tabellen extrahieren Sie über extract_tables je Seite; für strukturierte Weiterverarbeitung wandeln Sie jede Tabelle in einen pandas-DataFrame um (erste Zeile als Spaltenköpfe) und können mehrere Tabellen zu einer Exceldatei zusammenführen.
    
    ## reportlab, zum Erstellen neuer PDFs
    Für einfache Inhalte reicht die Canvas-API (Text- und Linienpositionen in Punkt-Koordinaten, Ursprung unten links). Für mehrseitige Dokumente mit Fließtext nutzen Sie stattdessen SimpleDocTemplate mit einer Story aus Paragraph-, Spacer- und PageBreak-Elementen und den Standard-Stilvorlagen.
    
    Kritische Regel: Verwenden Sie niemals Unicode-Hoch- oder -Tiefstellungszeichen in reportlab-PDFs. Die eingebauten Schriftarten enthalten diese Glyphen nicht, sie rendern als schwarze Kästen. Nutzen Sie stattdessen die XML-Markup-Tags sub und super innerhalb von Paragraph-Objekten. Bei direkt auf die Canvas gezeichnetem Text passen Sie stattdessen Schriftgröße und Position manuell an.
    
    ## Kommandozeilen-Werkzeuge
    pdftotext extrahiert reinen Text, mit der Option layout unter Beibehaltung des Layouts, mit den Optionen f und l für einen Seitenbereich.
    qpdf führt PDFs zusammen (empty, pages, dann die Dateien), teilt über Seitenbereiche auf, dreht einzelne Seiten über die rotate-Option, und entfernt Passwörter über password und decrypt.
    pdftk, falls verfügbar, bietet dieselben Grundoperationen (cat für Zusammenführen, burst für Aufteilen, rotate für Drehen) in eigener Syntax.
    
    # HÄUFIGE AUFGABEN
    
    ## Text aus gescannten PDFs extrahieren
    Wandeln Sie die Seiten zunächst in Bilder um, dann führen Sie OCR über pytesseract auf jedem Bild aus und fügen den erkannten Text seitenweise zusammen. Benötigt die Pakete pytesseract und pdf2image.
    
    ## Wasserzeichen hinzufügen
    Laden Sie die Wasserzeichenseite, wenden Sie sie über merge_page auf jede Seite des Zieldokuments an, speichern Sie das Ergebnis als neue Datei.
    
    ## Bilder extrahieren
    Nutzen Sie pdfimages aus den poppler-utils; das Werkzeug extrahiert alle eingebetteten Bilder mit fortlaufender Nummerierung.
    
    ## Passwortschutz setzen
    Fügen Sie alle Seiten in einen neuen Writer ein, rufen Sie encrypt mit Nutzer- und Eigentümerpasswort auf, speichern Sie verschlüsselt.
    
    # SCHNELLREFERENZ
    | Aufgabe | Bevorzugtes Werkzeug |
    | --- | --- |
    | PDFs zusammenführen | pypdf |
    | PDFs aufteilen | pypdf, eine Seite pro Datei |
    | Text extrahieren | pdfplumber |
    | Tabellen extrahieren | pdfplumber |
    | PDFs erstellen | reportlab, Canvas oder Platypus |
    | Zusammenführen über Kommandozeile | qpdf |
    | Gescannte PDFs per OCR lesbar machen | pytesseract, vorher in Bilder wandeln |
    | PDF-Formulare ausfüllen | pdf-lib oder pypdf, siehe die gesonderte Formular-Anleitung |
    
    # GRENZEN UND HINWEISE
    Für das Ausfüllen von PDF-Formularen gilt eine eigene, ausführlichere Anleitung, die Sie vor dem Start konsultieren. Für erweiterte Funktionen, JavaScript-Bibliotheken und detailliertere Beispiele existiert eine separate Referenz.
    
    # DEFINITION OF DONE
    [ ] Gewünschte Operation mit dem passenden Werkzeug ausgeführt, nicht mit einem unpassenden Ersatzwerkzeug
    [ ] Bei neuen PDFs: keine Unicode-Hoch- oder -Tiefstellungszeichen verwendet
    [ ] Bei Formularen: die gesonderte Formular-Anleitung befolgt
    [ ] Ergebnisdatei geöffnet und stichprobenartig auf Vollständigkeit geprüft
    [ ] Bei OCR: erkannter Text auf Plausibilität geprüft, nicht blind übernommen

    Einrichtung

    Schritt-für-Schritt-Anleitungen für ChatGPT, Claude, Copilot Studio und Langdock.

    ChatGPT

    OpenAI

    1. Kopieren Sie den Skill-Text oben über die Kopieren-Schaltfläche.
    2. Klicken Sie auf Ihr Profilbild und wählen Sie „Skills“.
    3. Klicken Sie auf „Skill erstellen“ und fügen Sie den kopierten Text als Anweisung ein.
    4. Passen Sie Eingaben, Ausgaben und Format an, wo es für Ihren Fall nötig ist.
    5. Speichern Sie den Skill. Er steht ab sofort in allen Chats zur Verfügung.
    Dokumentation

    Anthropic

    1. Kopieren Sie den Skill-Text oben über die Kopieren-Schaltfläche.
    2. Öffnen Sie claude.ai und gehen Sie in Ihrem Profil auf „Skills“.
    3. Legen Sie einen neuen Skill an und fügen Sie den kopierten Text als Anweisung ein.
    4. Der Skill arbeitet in claude.ai, in Claude Code und über die API.
    5. Verfügbar in den Tarifen Pro, Max, Team und Enterprise.
    Dokumentation

    Microsoft

    1. Kopieren Sie den Skill-Text oben über die Kopieren-Schaltfläche.
    2. Öffnen Sie Copilot Studio und legen Sie einen neuen Agent an.
    3. Fügen Sie den kopierten Text als Anweisung ein.
    4. Verbinden Sie bei Bedarf Wissensquellen und Werkzeuge.
    5. Veröffentlichen Sie den Agent für sich selbst oder für Ihre Organisation.
    Dokumentation

    1. Kopieren Sie den Skill-Text oben über die Kopieren-Schaltfläche.
    2. Öffnen Sie die Seitenleiste und klicken Sie auf „Skill hinzufügen“.
    3. Fügen Sie den kopierten Text direkt als Anweisung ein.
    4. Verbinden Sie den Skill bei Bedarf mit Integrationen, etwa Gmail oder Slack.
    5. Speichern Sie den Skill und geben Sie ihn für sich oder Ihr Team frei.
    Dokumentation

    Umsetzung

    1. Ausführungsumgebung sicherstellen

      Der Skill braucht eine Umgebung mit echter Code-Ausführung, in der die Python-Bibliotheken pypdf, pdfplumber und reportlab sowie die Kommandozeilen-Werkzeuge qpdf und pdftotext zur Verfügung stehen.

    2. Mit einer einfachen Operation beginnen

      Der Einstieg gelingt am besten mit einer einzelnen, überschaubaren Aufgabe, etwa dem Zusammenführen zweier Dateien, um Arbeitsweise und Werkzeugwahl kennenzulernen.

    3. Für wiederkehrende Aufgaben einsetzen

      Besonders geeignet ist der Skill für Routinearbeiten wie das monatliche Zusammenführen von Belegen oder das Verschlüsseln von Verträgen vor dem Versand.

    4. Formulare und OCR gesondert behandeln

      Für komplexe PDF-Formulare und für schlecht gescannte Vorlagen gelten eigene, ausführlichere Anleitungen, die vor dem Einsatz konsultiert werden sollten.

    5. Ergebnis immer stichprobenartig prüfen

      Vor der Weitergabe lohnt sich ein kurzer Blick auf das Ergebnis, insbesondere bei OCR-Text und ausgefüllten Formularfeldern.

    Stand:

    Im Workshop wird daraus Ihre Methode.

    Aus einem einzelnen Prompt wird eine wiederholbare Methode. Das zeigen wir im Workshop Vom Prompt zur Methode.

    Workshops ansehen

    Gespräch statt Pitch

    Erst verstehen, dann entscheiden. Wir nehmen uns Zeit für ein erstes Gespräch, ohne Verkaufsdruck, ohne Verpflichtung.

    Gespräch vereinbaren