summaryrefslogtreecommitdiff
diff options
context:
space:
mode:
authorJonas Knobloch <jonas.knobloch@t-online.de>2026-03-24 13:10:47 +0100
committerJonas Knobloch <jonas.knobloch@t-online.de>2026-03-24 15:40:59 +0100
commita63589d6584548b286825f4fb23202c35382032c (patch)
tree644a012417dd5df76af16088be38629d1748a2e9
parentac670c698540488c818a17c3749abf3ed4cb764a (diff)
Refactor tokenizer usage
-rw-r--r--llm/cmd/eval/main.go19
1 files changed, 7 insertions, 12 deletions
diff --git a/llm/cmd/eval/main.go b/llm/cmd/eval/main.go
index 758adad..ec9b7e9 100644
--- a/llm/cmd/eval/main.go
+++ b/llm/cmd/eval/main.go
@@ -3,7 +3,7 @@ package main
import (
"log"
- "github.com/jonasknobloch/mbpe"
+ "go.jknobloc.com/x/tokenizer/bpe"
"go.jknobloc.com/x/dataset"
"go.jknobloc.com/x/gpt2"
@@ -36,19 +36,14 @@ func model() *gpt2.Model {
return m
}
-func tokenizer() *mbpe.Tokenizer {
- m := mbpe.NewMBPE()
+func tokenizer() *bpe.Tokenizer {
+ var tok *bpe.Tokenizer
- if err := m.Load("gpt2/models/base/vocab.json", "gpt2/models/base/merges.txt"); err != nil {
+ if t, err := bpe.NewTokenizerFromFiles("gpt2/models/base/vocab.json", "gpt2/models/base/merges.txt"); err != nil {
log.Fatal(err)
+ } else {
+ tok = t
}
- t := mbpe.NewTokenizer(m)
-
- byteLevel := mbpe.NewByteLevel(false)
-
- t.SetPreTokenizer(byteLevel)
- t.SetDecoder(byteLevel)
-
- return t
+ return tok
}