AI & Analytics

Prompt Prefix hergebruiken met Key-Value Cache voor SLM

KDnuggets
Prompt Prefix hergebruiken met Key-Value Cache voor SLM

Samenvatting

Key-Value Cache hergebruikt vaste promptdelen en verkleint zo de pre-fill per supportticket.

Prompt Prefix en Key-Value Cache: wat er gebeurt

KDnuggets bespreekt in het tweede artikel van een korte reeks hoe kleine taalmodellen vaste delen van een prompt opnieuw kunnen gebruiken. Bij narrow automation bestaan prompts vaak uit een taakomschrijving, taxonomie en enkele voorbeelden; alleen het laatste deel verandert per ticket.

Transformers berekenen voor elk token per laag een key- en value-vector. Omdat die vectors alleen afhangen van tokens die eerder in de prompt staan, blijven ze gelijk wanneer het promptprefix niet verandert. De implementatie berekent dit vaste deel één keer en bewaart de resultaten in een key-value cache. Per nieuw ticket hoeft vervolgens alleen het gewijzigde deel opnieuw door het model.

De vergelijking start met de baseline: een few-shot prompt wordt voor elk ticket volledig gecodeerd. De auteur gebruikt Qwen2.5-0.5B-Instruct in float16 via Hugging Face Transformers. De test draait op een M2 MacBook Air met 24 GB RAM en een 16-core Neural Engine, met 600 supporttickets verdeeld over de labels billing, technical en account.

Prompt Prefix en Key-Value Cache: waarom dit belangrijk is

De techniek richt zich niet op de classificatie-uitkomst zelf. De eerdere methode voor beperkte uitvoerruimte blijft actief, zodat de beslissing één forward pass vraagt. De nieuwe optimalisatie pakt het resterende werk vóór die berekening aan: het opnieuw verwerken van tokens die niet zijn veranderd.

Daarmee ontstaat een duidelijke keuze tussen volledige hercodering en prefixhergebruik. Die keuze is vooral meetbaar bij prompts met een lang vast instructieblok en een korte variabele invoer. De bron presenteert dit als een praktische SLM-techniek, niet als een wijziging aan het model zelf.

Prompt Prefix en Key-Value Cache: concrete takeaway

Test bij een repetitieve SLM-taak eerst hoeveel prompttokens identiek blijven. Splits daarna de prompt op een vaste grens, meet de baseline met volledige hercodering en vergelijk die met een key-value cache onder dezelfde model- en hardware-instellingen.

Lees het volledige artikel
Meer over AI & Analytics →