AI Tekst Splitser — Splits Tekst voor RAG en Embeddings

Wat is het AI Tekst Splitser — Splits Tekst voor RAG en Embeddings

Een tekstsplitser (text chunker) verdeelt lange documenten in kleinere stukken die passen binnen het contextvenster van LLM's of de invoerlimieten van embedding-modellen. Dit is een kernstap bij het bouwen van RAG-systemen (Retrieval-Augmented Generation), vectordatabases en semantische zoekpijplijnen. Je kunt splitsen op geschat tokenaantal, tekenaantal of alineagrenzen — met instelbare overlap om context over stukgrenzen heen te behouden.

Hoe te gebruiken

  1. Plak de tekst die je wilt splitsen in het invoerveld.
  2. Kies de splitsmodus: Tokens (beste voor LLM-context), Tekens (exacte grootte) of Alinea's (natuurlijke grenzen).
  3. Stel de stukgrootte in (bijv. 512 tokens voor de meeste embedding-modellen) en optionele overlap (bijv. 50 tokens om context te behouden).
  4. Klik op Tekst splitsen — elk stuk verschijnt eronder met zijn token- en tekenaantal.
  5. Kopieer losse stukken met de kopieerknop naast elk stuk.

Wanneer te gebruiken

Laad je een pdf van 50 pagina's in een vectordatabase voor semantisch zoeken? Plak de geëxtraheerde tekst, zet 512 tokens met 50 tokens overlap, en je krijgt ongeveer 80 stukken die zinsgrenzen intact houden. De overlap draagt genoeg context over de knippunten heen zodat de betekenis behouden blijft, zodat je de stukken direct naar een embedding-model kunt sturen.

Veelgestelde vragen

Welke stukgrootte moet ik voor RAG gebruiken?

Voor de meeste embedding-modellen (text-embedding-3-small, text-embedding-ada-002, Cohere Embed) is 256–512 tokens de zoete plek. Grotere stukken bevatten meer context maar kunnen het semantische signaal verwateren. Voor LLM-contextvensters kun je tot 2000–4000 tokens per stuk gaan, afhankelijk van hoeveel stukken je tegelijk ophaalt.

Wat is stukoverlap en waarom is het belangrijk?

Overlap is het aantal tokens/tekens dat opeenvolgende stukken delen. Zonder overlap wordt een zin die precies op een stukgrens valt over twee stukken gesplitst en gaat context verloren. Een overlap van 10–20% (bijv. 50 tokens overlap voor stukken van 512 tokens) zorgt voor continuïteit tussen aangrenzende stukken.

Moet ik op tokens of tekens splitsen?

Splitsen op tokens is nauwkeuriger voor de limieten van LLM- en embedding-modellen. Splitsen op tekens geeft deterministische, exacte groottes — handig wanneer het downstream-systeem bytes of tekens meet, geen tokens. De alineamodus is het best om de natuurlijke documentstructuur te behouden.

Splitst deze tool zinnen midden in een woord?

Nee. De splitser probeert eerst op alineagrenzen te breken, dan op zinsafsluitende leestekens, dan op woordspaties. Alleen als er binnen een vooruitkijkvenster van 15% geen betere grens is, breekt hij midden in een woord.

Is er een limiet op de tekstlengte?

Geen harde limiet — de tool draait volledig in je browser. Zeer grote teksten (meer dan 1 miljoen tekens) kunnen je browser tijdens de verwerking vertragen, maar er is geen beperking aan de serverkant.

Kan ik deze tool delen met mijn ingevulde gegevens?

Ja. De URL wordt automatisch bijgewerkt terwijl je typt. Kopieer de link uit de adresbalk of gebruik de Deel-knop — iedereen die de link opent, ziet jouw gegevens al ingevuld.

Gerelateerde tools