Tekst-opdeling for AI

Hvad er Tekst-opdeling for AI

Tekst-opdeleren splitter lange tekster i bidder (chunks) tilpasset RAG-pipelines og embedding-modeller — med valgfri størrelse i tokens eller tegn og justerbart overlap mellem bidderne.

Sådan bruger du det

  1. Indsæt teksten, der skal deles.
  2. Vælg bidstørrelse og overlap.
  3. Kopiér bidderne, eller download dem.

Hvornår du bør bruge det

Til udviklere, der bygger RAG-systemer og har brug for fornuftig chunking før embedding, eksperimenterer med bidstørrelser for bedre genfinding, eller forbereder dokumenter til vektordatabaser.

Ofte stillede spørgsmål

Hvilken bidstørrelse skal jeg bruge til RAG?

For de fleste embeddingmodeller (text-embedding-3-small, text-embedding-ada-002, Cohere Embed) er 256-512 tokens det optimale interval. Større bidder bærer mere kontekst, men kan udvande det semantiske signal. For LLM-kontekstvinduer kan du gå op til 2000-4000 tokens pr. bid, afhængigt af hvor mange bidder du henter ad gangen.

Hvad er bid-overlap, og hvorfor betyder det noget?

Overlap er antallet af tokens/tegn, der deles mellem på hinanden følgende bidder. Uden overlap bliver en sætning, der falder præcis på en bidgrænse, delt over to bidder, hvilket mister kontekst. Et overlap på 10-20% (f.eks. 50 tokens overlap for 512-token-bidder) sikrer kontinuitet mellem tilstødende bidder.

Skal jeg dele efter tokens eller tegn?

At dele efter tokens er mere præcist for LLM- og embeddingmodellens grænser, da de tæller tokens. Del efter tegn, når du har brug for præcis kontrol over størrelsen uafhængigt af model.

Deler dette værktøj sætninger midt i et ord?

Nej. Værktøjet forsøger at respektere ord- og sætningsgrænser, når det deler, så bidderne slutter på et naturligt punkt i stedet for midt i et ord.

Er der en grænse for tekstlængden?

Ingen hård grænse — værktøjet kører helt i din browser. Meget lange tekster (over 1 million tegn) kan bremse din browser under behandlingen, men der er ingen serverbegrænsning.

Relaterede værktøjer