summaryrefslogtreecommitdiff
path: root/tokenizer
diff options
context:
space:
mode:
authorJonas Knobloch <jonas.knobloch@t-online.de>2026-04-24 11:07:01 +0200
committerJonas Knobloch <jonas.knobloch@t-online.de>2026-04-24 11:07:01 +0200
commit1e02a5ec7f7794bb542e99ceb804ed88048b6b54 (patch)
tree5db849f4eaa326f9b6511c315180e540f00c393e /tokenizer
parent875ac19922932b12f6357d64a460c06d031000e7 (diff)
Access artifacts via shelf
Diffstat (limited to 'tokenizer')
-rw-r--r--tokenizer/bpe/cmd/tokenize/main.go5
1 files changed, 3 insertions, 2 deletions
diff --git a/tokenizer/bpe/cmd/tokenize/main.go b/tokenizer/bpe/cmd/tokenize/main.go
index 08d88aa..13926b7 100644
--- a/tokenizer/bpe/cmd/tokenize/main.go
+++ b/tokenizer/bpe/cmd/tokenize/main.go
@@ -11,6 +11,7 @@ import (
"go.jknobloc.com/x/dataset"
"go.jknobloc.com/x/llm"
+ "go.jknobloc.com/x/shelf"
"go.jknobloc.com/x/tokenizer/bpe"
"go.jknobloc.com/x/tui"
)
@@ -87,7 +88,7 @@ func main() {
func data() *dataset.ParquetReader {
var simple *dataset.ParquetReader
- if r, err := dataset.NewParquetReader("dataset/cmd/dataset/tmp/wikipedia/simple/train"); err != nil {
+ if r, err := dataset.NewParquetReader(shelf.Abs("data/wikipedia/20231101/simple/train")); err != nil {
log.Fatal(err)
} else {
simple = r
@@ -99,7 +100,7 @@ func data() *dataset.ParquetReader {
func tokenizer() llm.Tokenizer {
var tok *bpe.Tokenizer
- if t, err := bpe.NewTokenizerFromFiles("gpt2/models/base/vocab.json", "gpt2/models/base/merges.txt"); err != nil {
+ if t, err := bpe.NewTokenizerFromFiles(shelf.Abs("models/gpt2/vocab.json"), shelf.Abs("models/gpt2/merges.txt")); err != nil {
log.Fatal(err)
} else {
tok = t