summaryrefslogtreecommitdiff
path: root/llm/cmd/eval/perplexity.go
blob: b84b659292b9ecb58f1a10019a3b874711a6c220 (plain)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
package main

import (
	"fmt"
	"log"
	"math"

	"go.jknobloc.com/x/llm"
)

type pplResult struct {
	v float64
	n int
}

func perplexity() {
	d := data()

	m := model()
	t := tokenizer()

	e := llm.NewEvaluator(m, t, func(job llm.Job, logProbs []float32, tokens []int) pplResult {
		total := float64(0)

		n := 0

		for _, p := range logProbs {
			total -= float64(p)

			n++
		}

		return pplResult{
			v: total,
			n: n,
		}
	}, llm.EvaluatorConfig{
		BatchSize:  1,
		NumWorkers: 4,
	})

	total := float64(0)
	n := 0

	cfg := llm.TokenBufferConfig{
		Window:     1024,
		Stride:     512,
		PadLeft:    false, // probably not fine since we don't adjust model inputs for padding
		PadRight:   true,  // fine since we remove padded log probs anyway
		PadTokenID: 50256,
	}

	if err := e.RunAndCollect("Perplexity", d, cfg, func(r pplResult) error {
		total += r.v
		n += r.n

		return nil
	}); err != nil {
		log.Fatal(err)
	}

	avg := total / float64(n)
	ppl := math.Exp(avg)

	fmt.Println(ppl)
	fmt.Printf("%d tokens\n", n)

	if err := m.Destroy(); err != nil {
		log.Fatal(err)
	}
}