如何读取Golang中的大型平面文件

时间:2015-03-28 02:54:43

标签: go buffer

我有一个平面文件,其中包含339276行文本,大小为62.1 MB。我试图读取所有行,根据我的一些条件解析它们,然后将它们插入到数据库中。

我最初尝试使用bufio.Scan()循环和bufio.Text()来获取行,但是我的缓冲区空间不足。我切换到使用bufio.ReadLine / ReadString / ReadByte(我尝试了每个)并且每个都有相同的问题。我没有足够的缓冲空间。

我尝试使用read并设置缓冲区大小,但正如文档所说它实际上是一个可以变小但不会超过64 * 1024字节的const。然后我尝试使用File.ReadAt设置起始postilion并将其移动,因为我带来了每个部分无济于事。我看了下面的例子和解释(不是详尽的清单):

Read text file into string array (and write) How to Read last lines from a big file with Go every 10 secs reading file line by line in go

如何将整个文件(逐行或整个文件)读入切片,以便我可以对行进行操作?

以下是我尝试过的一些代码:

                 file, err := os.Open(feedFolder + value)
                 handleError(err)
                 defer file.Close()
                 //              fileInfo, _ := file.Stat()
                 var linesInFile []string

             r := bufio.NewReader(file)
             for {
                     path, err := r.ReadLine("\n") // 0x0A separator = newline

                     linesInFile = append(linesInFile, path)
                     if err == io.EOF {
                             fmt.Printf("End Of File: %s", err)
                             break
                     } else if err != nil {
                             handleError(err) // if you return error
                     }
             }
             fmt.Println("Last Line: ", linesInFile[len(linesInFile)-1])

这是我尝试过的其他内容:

var fileSize int64 = fileInfo.Size()
    fmt.Printf("File Size: %d\t", fileSize)
    var bufferSize int64 = 1024 * 60
    bytes := make([]byte, bufferSize)
    var fullFile []byte
    var start int64 = 0
    var interationCounter int64 = 1
    var currentErr error = nil
         for currentErr != io.EOF {
            _, currentErr = file.ReadAt(bytes, st)
            fullFile = append(fullFile, bytes...)
            start = (bufferSize * interationCounter) + 1
            interationCounter++
          }
     fmt.Printf("Err: %s\n", currentErr)
     fmt.Printf("fullFile Size: %s\n", len(fullFile))
     fmt.Printf("Start: %d", start)

     var currentLine []string


   for _, value := range fullFile {
      if string(value) != "\n" {
          currentLine = append(currentLine, string(value))
      } else {
         singleLine := strings.Join(currentLine, "")
         linesInFile = append(linesInFile, singleLine)
         currentLine = nil
              }   
      }

我不知所措。要么我不明白缓冲区是如何工作的,要么我不理解其他东西。谢谢阅读。

4 个答案:

答案 0 :(得分:5)

循环中的

bufio.Scan()bufio.Text()对于我来说对于尺寸更大的文件非常有效,所以我认为你的行超出了缓冲区容量。然后

  • 检查你的行结尾
  • 您使用哪个Go版本path, err :=r.ReadLine("\n") // 0x0A separator = newline?看起来func (b *bufio.Reader) ReadLine() (line []byte, isPrefix bool, err error)具有专门针对您的用例的返回值isPrefix http://golang.org/pkg/bufio/#Reader.ReadLine

答案 1 :(得分:3)

目前尚不清楚在解析它们并将它们插入数据库之前必须读入所有行。尽量避免这种情况。

你有一个小文件:“一个平面文件,其中包含339276行文本,大小为62.1 MB。”例如,

package main

import (
    "bytes"
    "fmt"
    "io"
    "io/ioutil"
)

func readLines(filename string) ([]string, error) {
    var lines []string
    file, err := ioutil.ReadFile(filename)
    if err != nil {
        return lines, err
    }
    buf := bytes.NewBuffer(file)
    for {
        line, err := buf.ReadString('\n')
        if len(line) == 0 {
            if err != nil {
                if err == io.EOF {
                    break
                }
                return lines, err
            }
        }
        lines = append(lines, line)
        if err != nil && err != io.EOF {
            return lines, err
        }
    }
    return lines, nil
}

func main() {
    // a flat file that has 339276 lines of text in it for a size of 62.1 MB
    filename := "flat.file"
    lines, err := readLines(filename)
    fmt.Println(len(lines))
    if err != nil {
        fmt.Println(err)
        return
    }
}

答案 2 :(得分:1)

在我看来,readLines的变体比建议的peterSO更短,更快。

func readLines(filename string) (map[int]string, error) {
    lines := make(map[int]string)

    data, err := ioutil.ReadFile(filename)
    if err != nil {
        return nil, err
    }

    for n, line := range strings.Split(string(data), "\n") {
        lines[n] = line
    }

    return lines, nil
}

答案 3 :(得分:0)

package main

import (
    "fmt"
    "os"
    "log"
    "bufio"
)

func main() {
    FileName := "assets/file.txt"
    file, err := os.Open(FileName)
    if err != nil {
        log.Fatal(err)
    }
    defer file.Close()

    scanner := bufio.NewScanner(file)

    for scanner.Scan() { 
        fmt.Println(scanner.Text()) 

    }
}