> ## Documentation Index
> Fetch the complete documentation index at: https://docs.yourhomie.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Webseiten

> Hol Inhalte deiner Webseiten in einen Wissensspeicher — crawle eine Website, lies eine Sitemap oder füge eine einzelne Seite hinzu — und halte sie aktuell.

homie kann die Inhalte deiner Webseiten extrahieren und in Wissen verwandeln, aus dem der Assistent antwortet. Öffne deinen [Wissensspeicher](/de/user-guide/knowledge/knowledge-stores), geh zu **Quellen → Webseiten** und wähle **Hinzufügen**, um den Dialog **Website hinzufügen** zu öffnen.

## So fügst du Seiten hinzu

Der Dialog bietet drei Modi:

<Tabs>
  <Tab title="Crawl Website">
    Gib eine Domain-URL ein (zum Beispiel `www.example.de`). homie folgt den Links und **entdeckt alle erreichbaren Seiten** und zeigt dann eine Vorschau vor dem Import. Wähle **Website crawlen**, um die Erkennung zu starten.

    Am besten, wenn du den Großteil einer Website willst und keine Sitemap pflegst.
  </Tab>

  <Tab title="Sitemap">
    Gib deine Sitemap-URL ein (zum Beispiel `www.example.de/sitemap.xml`). homie liest sie aus — inklusive verschachtelter Sub-Sitemaps — um die Seiten aufzulisten, und zeigt dieselbe Vorschau. Wähle **Sitemap auslesen**.

    Am besten, wenn du eine Sitemap pflegst und eine genaue, vollständige Liste willst.
  </Tab>

  <Tab title="Einzelne Seite">
    Gib genau eine URL ein (zum Beispiel `www.example.de/kontakt`) und wähle **Seite hinzufügen**. Die Seite wird direkt ausgelesen — keine Erkennung, keine Vorschau.

    Am besten, um eine bestimmte Einzelseite hinzuzufügen.
  </Tab>
</Tabs>

## Prüfen und importieren

Bei **Crawl Website** und **Sitemap** erkennt homie zuerst die Seiten und öffnet eine Vorschau, damit du genau entscheidest, was importiert wird.

Eine Kapazitäts-Übersicht oben zeigt:

| Zahl             | Bedeutung                                                                                                              |
| ---------------- | ---------------------------------------------------------------------------------------------------------------------- |
| **Insgesamt**    | Seiten, die nach deinen Filtern übrig bleiben.                                                                         |
| **Bekannt**      | Seiten, die bereits in diesem Wissensspeicher sind.                                                                    |
| **Neu**          | Insgesamt minus Bekannt.                                                                                               |
| **Importierbar** | Neue Seiten, begrenzt durch dein verbleibendes Seitenkontingent — inline angezeigt als `(unbegrenzt)` oder `(max. N)`. |

Darunter ist ein **Baum der gefundenen URLs** in aufklappbaren Ordnern gruppiert und lädt nach Bedarf nach — nutze **Load more URLs** bei großen Websites. War die Erkennung nur teilweise (etwa weil eine Sub-Sitemap fehlschlug), siehst du **Vorschau unvollständig.**

Du wählst die Seiten hier nicht einzeln aus. Stattdessen formst du die Menge über **Filter** und wählst dann **Erstellen**, um zu importieren (oder **Zurück**, um zu verwerfen). homie importiert jede passende Seite bis zu deinem importierbaren Limit und startet die Verarbeitung.

### Filter

Öffne **Filter**, um einzugrenzen, was importiert wird:

* **Produktseiten einschließen** — standardmäßig aus. Lass es aus, wenn du deinen Katalog bereits über [Produktdaten](/de/user-guide/knowledge/product-data) oder einen verbundenen Shopify-Shop bereitstellst, sonst werden Produktseiten doppelt erfasst.
* **Kategorieseiten einschließen** — standardmäßig aus. Aktiviere es, um Kategorie- oder Collection-Seiten einzubeziehen.
* **Pfade einschließen** / **Pfade ausschließen** — füge Regeln mit einem Übereinstimmungstyp hinzu: **Beginnt mit**, **Endet mit**, **Enthält**, **Exakt** oder **Wildcard (\*)**. Nach Änderungen wähle **Vorschau aktualisieren**, um die Zahlen zu aktualisieren.

<Note>
  Die Erkennung von Produkt- und Kategorieseiten basiert auf URL-Mustern, nicht auf dem Seiteninhalt — prüf daher die Vorschau vor dem Import.
</Note>

## Deine Webseiten-Quellen verwalten

Jede hinzugefügte Webseite erscheint als Quelle, die du aufklappen kannst:

* Ein **Typ**-Badge — **Gecrawlt**, **Sitemap** oder **Einzeln** — mit der Seitenzahl und dem Zeitpunkt des letzten Crawls bzw. Auslesens.
* Bei Crawl- und Sitemap-Quellen die aktiven **Filter**-Pills und ein **Zahnrad**-Icon, um die Einstellungen zu bearbeiten.
* Klapp eine Quelle auf, um ihren **URL-Baum** (Ordner und einzelne Seiten) mit jeweils einem Status zu sehen.

Nutze die **Suche** (**URLs durchsuchen…**), um Seiten zu finden, den **Status-Filter** (**Alle** / **Fehler** / **In Verarbeitung**) und **Alle auswählen** für Sammelaktionen. Lange Listen laden beim Scrollen nach.

## Status

Die Status aktualisieren sich live, während homie deine Seiten ausliest.

**Quellen-Status**

| Status               | Bedeutung                                                            |
| -------------------- | -------------------------------------------------------------------- |
| **In Warteschlange** | Wartet auf die Verarbeitung.                                         |
| **In Verarbeitung**  | Seiten werden ausgelesen; ein Fortschritt in Prozent wird angezeigt. |
| **Fehler**           | Etwas ist schiefgelaufen — prüf die fehlgeschlagenen Seiten.         |

**Seiten-Status**

| Status                       | Bedeutung                                                                |
| ---------------------------- | ------------------------------------------------------------------------ |
| **Training läuft**           | Die Seite ist in der Warteschlange oder wird ausgelesen.                 |
| **Status wird aktualisiert** | Der Seitenstatus wird aktualisiert.                                      |
| **Trainiert**                | Die Seite steht dem Assistenten zur Verfügung.                           |
| **Fehler**                   | Die Seite ist fehlgeschlagen — wähle sie aus, um es erneut zu versuchen. |

## Webseiten-Inhalte aktuell halten

Webseiten-Inhalte ändern sich mit der Zeit, deshalb hält homie sie auf zwei Wegen aktuell:

* **Automatisch** — homie liest deine Webseiten-Quellen im Aktualisierungsintervall des Wissensspeichers neu aus (manuell, täglich, wöchentlich oder monatlich). Stell das unter **Einstellungen → Aktualisierung von Webseiten** ein (siehe [Einführung](/de/user-guide/knowledge/knowledge-stores)).
* **Manuell** — wähle eine oder mehrere Quellen aus und wähle **Neu verarbeiten → Alle**, um alles neu zu erkennen und auszulesen, oder **Neu verarbeiten → Nur Fehler**, um nur die fehlgeschlagenen Seiten erneut zu versuchen. Eine einzelne fehlgeschlagene Seite kannst du auch über ihr Status-Badge erneut versuchen.

### Einstellungen einer Quelle bearbeiten

Wähle bei einer Crawl- oder Sitemap-Quelle das **Zahnrad**-Icon, um ihre Filter anzupassen und **Neue URLs automatisch aufnehmen** umzuschalten (standardmäßig an — künftige Aktualisierungen nehmen neu gefundene Seiten auf; schalte es aus, um nur bereits bekannte Seiten zu aktualisieren). Beim Speichern werden die Einstellungen übernommen und die Quelle sofort neu ausgelesen.

<Tip>
  Verarbeite die Quelle nach größeren Änderungen an deiner Website neu — neue Richtlinienseiten, geänderte Versandbedingungen oder ein Redesign — damit der Assistent nie veraltete Informationen zitiert.
</Tip>

## Eine Seite ansehen oder entfernen

Wähle eine Seite, um die **URL-Details** zu öffnen — **Domain**, **Zeichen gesamt**, Dokument-ID, letzte Aktualisierung, einen etwaigen letzten Fehler und eine schreibgeschützte Vorschau des extrahierten **Seiteninhalts**.

Um Seiten aus einer Crawl- oder Sitemap-Quelle zu entfernen, nutze **Dauerhaft ausschließen** an einer URL (oder **Ordner dauerhaft ausschließen** an einem Ordner). Ausgeschlossene Seiten werden bei künftigen Aktualisierungen übersprungen. Einzelseiten-Quellen bieten stattdessen **URL löschen**.

## Seitenkontingent

Die Karte **Seitenkontingent** zeigt, wie viele Webseiten-Inhalte du speichern kannst:

* **Insgesamt** — das Seitenlimit deines Plans (oder **Unbegrenzt**).
* **Verwendet** — die in deiner gesamten Organisation genutzten Seiten (alle Wissensspeicher zusammen).
* **In diesem Speicher** — die hier gespeicherten Seiten.
* **Verfügbar** — wie viele dir noch bleiben.

Ist das Kontingent erreicht, fällt **Importierbar** auf 0 und neue Importe sind blockiert, bis du Seiten entfernst oder deinen Plan upgradest.
