summaryrefslogtreecommitdiff
path: root/dataset
diff options
context:
space:
mode:
Diffstat (limited to 'dataset')
-rw-r--r--dataset/cmd/dataset/main.go4
-rw-r--r--dataset/parquet.go (renamed from dataset/reader.go)10
2 files changed, 7 insertions, 7 deletions
diff --git a/dataset/cmd/dataset/main.go b/dataset/cmd/dataset/main.go
index 5fd633b..8bd892d 100644
--- a/dataset/cmd/dataset/main.go
+++ b/dataset/cmd/dataset/main.go
@@ -19,9 +19,9 @@ func main() {
split := filepath.Join(root, "train")
- var reader *dataset.Reader
+ var reader *dataset.ParquetReader
- if r, err := dataset.NewReader(split); err != nil {
+ if r, err := dataset.NewParquetReader(split); err != nil {
log.Fatal(err)
} else {
reader = r
diff --git a/dataset/reader.go b/dataset/parquet.go
index e882332..c80758f 100644
--- a/dataset/reader.go
+++ b/dataset/parquet.go
@@ -15,13 +15,13 @@ import (
"github.com/apache/arrow-go/v18/parquet/pqarrow"
)
-type Reader struct {
+type ParquetReader struct {
shards []string
batchSize int64
err error
}
-func NewReader(name string) (*Reader, error) {
+func NewParquetReader(name string) (*ParquetReader, error) {
var shards []string
if matches, err := filepath.Glob(filepath.Join(name, "*.parquet")); err != nil {
@@ -36,7 +36,7 @@ func NewReader(name string) (*Reader, error) {
slices.Sort(shards)
- r := &Reader{
+ r := &ParquetReader{
shards: shards,
batchSize: 1024,
}
@@ -44,11 +44,11 @@ func NewReader(name string) (*Reader, error) {
return r, nil
}
-func (r *Reader) Err() error {
+func (r *ParquetReader) Err() error {
return r.err
}
-func (r *Reader) Texts(column string) iter.Seq[string] {
+func (r *ParquetReader) Texts(column string) iter.Seq[string] {
return func(yield func(string) bool) {
for _, name := range r.shards {
err := read(name, column, r.batchSize, yield)