summaryrefslogtreecommitdiff
path: root/research/sander/reference.go
blob: d6aa46604e828460cf01c57b267780141b37a7b3 (plain)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
package sander

import (
	"go.jknobloc.com/x/tokenizer/bpe"
)

func UnusedTokensGPT2(tokenizer *bpe.Tokenizer) map[int64]struct{} {
	unused := map[int64]struct{}{
		177: {},
		178: {},
		179: {},
		180: {},
		181: {},
		182: {},
		183: {},
		184: {},
		185: {},
		186: {},
		187: {},
	}

	alphabet := bpe.InitialAlphabet()

	itoa := bpe.Itoa(tokenizer)

	for id := range unused {
		token, ok := itoa[id]

		if !ok {
			panic("unknown token id")
		}

		if token != string(alphabet[id]) {
			panic("unexpected token")
		}
	}

	return unused
}

func UnusedTokensMBPE(tokenizer *bpe.Tokenizer) map[int64]struct{} {
	unused := make(map[int64]struct{})

	vocab := bpe.Vocab(tokenizer)

	mask := bpe.ReachableTokens(tokenizer, vocab)

	for i := range vocab {
		if mask[i] {
			continue
		}

		unused[int64(i)] = struct{}{}
	}

	return unused
}

// TODO we could just filter some input data