When a model generates a sequence, taking the single best token at each step (greedy) can paint you into a corner — a great first word can force a bad sentence. Beam search hedges: keep the top-k partial sequences alive at every step, extend them all, and prune back to k. A small amount of lookahead recovers high-probability sequences that greedy throws away. The workhorse decoder of translation and speech.
The demo shows a case where beam width 2 recovers a better sequence than greedy: live demo
“Bigger beams always give better text.” — for open-ended generation large beams can produce bland, repetitive output; sampling often reads better. cited
A little lookahead beats pure greed. decoding
On i-13, greedy scores 0.18 (a strong first token, weak finish) but beam-2 finds 0.36 — the better sequence: