成人h动漫精品一区二区,成人无码网www在线观看

Rumah

pembangunan bahagian belakang

Golang

Pemprosesan CSV Besar Menggunakan Go

Linda Hamilton

Nov 27, 2024 am 12:54 AM

Ideanya ialah:

Memandangkan CSV tiruan yang besar (1 juta baris) mengandungi sampel data pelanggan dan melakukan pemprosesan dengan matlamat di bawah:

Ekstrak data daripada CSV

Kira bilangan data / baris

Mengumpulkan bilangan pelanggan untuk setiap bandar

Isih bandar mengikut pelanggan dikira dari tertinggi hingga terendah

Kira masa pemprosesan

Contoh CSV pelanggan boleh dimuat turun di sini https://github.com/datablist/sample-csv-files

Muat Dan Ekstrak Data

Nampaknya Go mempunyai lib standard untuk pemprosesan CSV. Kami tidak memerlukan pergantungan pihak ketiga untuk menyelesaikan masalah kami lagi yang bagus. Jadi penyelesaiannya agak mudah:

  // open the file to a reader interface
  c, err := os.Open("../data/customers-1000000.csv")
  if err != nil {
    log.Fatal(err)
  }
  defer c.Close()

  // load file reader into csv reader
  // Need to set FieldsPerRecord to -1 to skip fields checking
  r := csv.NewReader(c)
  r.FieldsPerRecord = -1
  r.ReuseRecord = true
  records, err := r.ReadAll()
  if err != nil {
    log.Fatal(err)
  }

Buka fail dari laluan yang diberikan
Muatkan fail yang dibuka ke pembaca csv
Memegang semua nilai rekod / baris csv yang diekstrak ke dalam kepingan rekod untuk diproses kemudian

FieldsPerRecord ditetapkan kepada -1 kerana saya ingin melangkau medan menyemak pada baris memandangkan bilangan medan atau lajur mungkin berbeza dalam setiap format

Pada keadaan ini kami sudah dapat memuatkan dan mengekstrak semua data daripada csv dan bersedia untuk keadaan pemprosesan seterusnya. Kami juga akan dapat mengetahui bilangan baris dalam CSV dengan menggunakan fungsi len(rekod).

Mengumpulkan Jumlah Pelanggan kepada Setiap Bandar

Kini kami dapat mengulangi rekod dan mencipta peta mengandungi nama bandar dan jumlah pelanggan kelihatan seperti ini:

["Jakarta": 10, "Bandung": 200, ...]

Data bandar dalam baris csv terletak dalam indeks ke-7 dan kodnya akan kelihatan seperti ini

  // create hashmap to populate city with total customers based on the csv data rows
  // hashmap will looks like be ["city name": 100, ...]
  m := map[string]int{}
  for i, record := range records {
    // skip header row
    if i == 0 {
    continue
    }
    if _, found := m[record[6]]; found {
      m[record[6]]++
    } else {
      m[record[6]] = 1
    }
  }

Jika peta bandar tidak wujud, buat peta baharu dan tetapkan jumlah pelanggan sebagai 1. Jika tidak, tambahkan jumlah bilangan bandar tertentu.

Kini kami mempunyai peta m yang mengandungi koleksi bandar dan berapa ramai pelanggan di dalamnya. Pada ketika ini kami telah menyelesaikan masalah mengumpulkan bilangan pelanggan untuk setiap bandar.

Mengisih Jumlah Pelanggan Tertinggi

Saya cuba mencari adakah terdapat sebarang fungsi dalam lib standard untuk mengisih peta tetapi malangnya saya tidak menemuinya. Pengisihan hanya mungkin untuk hirisan kerana kami boleh menyusun semula susunan data berdasarkan kedudukan indeks. Jadi ya, mari kita buat potongan daripada peta semasa kita.

// convert to slice first for sorting purposes
dc := []CityDistribution{}
for k, v := range m {
  dc = append(dc, CityDistribution{City: k, CustomerCount: v})
}

Sekarang bagaimana kami mengisihnya mengikut Kiraan Pelanggan daripada tertinggi ke terendah? Algoritma yang paling biasa untuk ini adalah menggunakan pendek gelembung. Walaupun ia bukan yang terpantas tetapi ia boleh melakukan kerja.

Isih Buih ialah algoritma pengisihan paling mudah yang berfungsi dengan menukar elemen bersebelahan berulang kali jika ia berada dalam susunan yang salah. Algoritma ini tidak sesuai untuk set data yang besar kerana kerumitan masa purata dan kes terburuknya agak tinggi.

Rujukan: https://www.geeksforgeeks.org/bubble-sort-algorithm/

Menggunakan kepingan kami, ia akan melingkari data dan menyemak nilai indeks seterusnya dan menukarnya jika data semasa kurang daripada indeks seterusnya. Anda boleh menyemak algoritma terperinci pada tapak web rujukan.

Sekarang proses pengisihan kami boleh jadi seperti ini

  // open the file to a reader interface
  c, err := os.Open("../data/customers-1000000.csv")
  if err != nil {
    log.Fatal(err)
  }
  defer c.Close()

  // load file reader into csv reader
  // Need to set FieldsPerRecord to -1 to skip fields checking
  r := csv.NewReader(c)
  r.FieldsPerRecord = -1
  r.ReuseRecord = true
  records, err := r.ReadAll()
  if err != nil {
    log.Fatal(err)
  }

Menjelang penghujung gelung, kepingan terakhir akan memberi kami data yang diisih.

Kira Masa Pemprosesan

Mengira masa pemprosesan agak mudah, kami mendapat cap masa sebelum & selepas melaksanakan proses utama program dan mengira perbezaannya. Dalam Go pendekatannya hendaklah cukup mudah:

["Jakarta": 10, "Bandung": 200, ...]

Hasilnya

Jalankan program dengan arahan

  // create hashmap to populate city with total customers based on the csv data rows
  // hashmap will looks like be ["city name": 100, ...]
  m := map[string]int{}
  for i, record := range records {
    // skip header row
    if i == 0 {
    continue
    }
    if _, found := m[record[6]]; found {
      m[record[6]]++
    } else {
      m[record[6]] = 1
    }
  }

Yang dicetak ialah kiraan baris, data diisih dan masa pemprosesan. Sesuatu seperti ini di bawah:

Large CSV Processing Using Go

Seperti yang dijangkakan daripada prestasi Go, ia mengendalikan 1 juta baris csv di bawah 1 saat!

Semua kod yang lengkap sudah diterbitkan pada Repositori Github saya:

https://github.com/didikz/csv-processing/tree/main/golang

Pengajaran

Pemprosesan CSV dalam Go sudah tersedia dalam lib standard, tidak perlu menggunakan lib pihak ketiga
Memproses data agak mudah. Cabarannya ialah untuk mengetahui cara mengisih data kerana perlu dilakukan secara manual

Apa yang terlintas di fikiran?

Saya fikir penyelesaian semasa saya mungkin boleh dioptimumkan lagi kerana saya menggelungkan semua rekod yang diekstrak csv untuk dipetakan dan jika kami menyemak pada sumber ReadAll(), ia juga mempunyai gelung untuk mencipta kepingan berdasarkan pembaca fail yang diberikan. Dengan ini, 1 baris Mil boleh menghasilkan 2 x gelung untuk 1 Mil data yang tidak bagus.

Saya fikir jika saya boleh membaca data terus daripada Pembaca fail, ia hanya memerlukan 1 gelung kerana saya boleh membuat peta terus daripadanya. Kecuali kepingan rekod akan digunakan di tempat lain tetapi tidak dalam kes ini.

Saya masih tiada masa untuk memikirkannya lagi, tetapi saya juga memikirkan beberapa kelemahan jika saya akan melakukannya secara manual:

Mungkin perlu mengendalikan lebih banyak ralat proses penghuraian
Saya tidak pasti betapa pentingnya ia akan mengurangkan masa pemprosesan untuk mempertimbangkan penyelesaian itu berbaloi atau tidak

Selamat Pengekodan!

Atas ialah kandungan terperinci Pemprosesan CSV Besar Menggunakan Go. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undress AI Tool

Gambar buka pakaian secara percuma

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Clothoff.io

Penyingkiran pakaian AI

Video Face Swap

Tukar muka dalam mana-mana video dengan mudah menggunakan alat tukar muka AI percuma kami!

Tunjukkan Lagi

Artikel Panas

Panduan: bilah bintang simpan fail lokasi/simpan fail hilang/tidak menyimpan

4 minggu yang lalu By DDD

Oguri Cap Build Guide | Musume Derby Pretty

2 minggu yang lalu By Jack chen

Agnes Tachyon Build Guide | Musume Derby Pretty

1 minggu yang lalu By Jack chen

Dune: Awakening - Lanjutan Planetologist Quest Walkthrough

4 minggu yang lalu By Jack chen

Tarikh Segala -galanya: Panduan Hubungan Dirk dan Harper

4 minggu yang lalu By Jack chen

Tunjukkan Lagi

Alat panas

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Tunjukkan Lagi

Topik panas

Di manakah pintu masuk log masuk untuk e-mel gmail?

8637

Tutorial Java

1783

Tutorial CakePHP

1728

Tutorial Laravel

1577

Tutorial PHP

1442

Tunjukkan Lagi

Related knowledge

Apakah implikasi pautan statik Go secara lalai? Jun 19, 2025 am 01:08 AM

Pergi menyusun program ke dalam binari mandiri secara lalai, sebab utama adalah menghubungkan statik. 1. Penyebaran yang lebih mudah: Tiada pemasangan tambahan perpustakaan ketergantungan, boleh dijalankan secara langsung di seluruh pengagihan Linux; 2. Saiz binari yang lebih besar: termasuk semua kebergantungan menyebabkan saiz fail meningkat, tetapi boleh dioptimumkan melalui bendera bangunan atau alat pemampatan; 3. Predikabiliti dan keselamatan yang lebih tinggi: Elakkan risiko yang dibawa oleh perubahan dalam versi perpustakaan luaran dan meningkatkan kestabilan; 4. Fleksibiliti operasi terhad: Tidak boleh kemas kini panas perpustakaan yang dikongsi, dan penyusunan semula dan penggunaan diperlukan untuk memperbaiki kelemahan ketergantungan. Ciri-ciri ini sesuai untuk alat CLI, microservices dan senario lain, tetapi perdagangan diperlukan dalam persekitaran di mana penyimpanan dihadkan atau bergantung kepada pengurusan berpusat.

Bagaimanakah pergi memastikan keselamatan memori tanpa pengurusan memori manual seperti di C? Jun 19, 2025 am 01:11 AM

Goensuresmemorysafetywithoutmanualmanagementthroughautomaticgarbagecollection,nopointerarithmetic,safeconcurrency,andruntimechecks.First,Go’sgarbagecollectorautomaticallyreclaimsunusedmemory,preventingleaksanddanglingpointers.Second,itdisallowspointe

Bagaimana saya membuat saluran buffered di Go? (mis., Buat (Chan int, 10)) Jun 20, 2025 am 01:07 AM

Untuk membuat saluran penampan di Go, hanya tentukan parameter kapasiti dalam fungsi membuat. Saluran Buffer membolehkan operasi penghantaran untuk menyimpan data sementara apabila tiada penerima, selagi kapasiti yang ditentukan tidak melebihi. Sebagai contoh, Ch: = Make (Chanint, 10) mencipta saluran penampan yang boleh menyimpan sehingga 10 nilai integer; Tidak seperti saluran yang tidak dibuang, data tidak akan disekat dengan segera apabila menghantar, tetapi data akan disimpan sementara dalam penampan sehingga ia diambil oleh penerima; Apabila menggunakannya, sila ambil perhatian: 1. Tetapan kapasiti harus munasabah untuk mengelakkan sisa memori atau penyekatan kerap; 2. Penimbal perlu mencegah masalah ingatan daripada terkumpul selama -lamanya dalam penampan; 3. Isyarat boleh diluluskan oleh jenis Chanstruct {} untuk menjimatkan sumber; Senario biasa termasuk mengawal bilangan konkurensi, model pengguna dan pembezaan

Bagaimanakah anda boleh menggunakan tugas pengaturcaraan sistem? Jun 19, 2025 am 01:10 AM

GO sangat sesuai untuk pengaturcaraan sistem kerana ia menggabungkan prestasi bahasa yang disusun seperti C dengan kemudahan penggunaan dan keselamatan bahasa moden. 1. Dari segi operasi fail dan direktori, pakej OS Go menyokong penciptaan, penghapusan, penamaan semula dan memeriksa sama ada fail dan direktori wujud. Gunakan OS.READFILE untuk membaca keseluruhan fail dalam satu baris kod, yang sesuai untuk menulis skrip sandaran atau alat pemprosesan log; 2. Dari segi pengurusan proses, fungsi exec.command pakej OS/EXEC boleh melaksanakan arahan luaran, menangkap output, menetapkan pembolehubah persekitaran, aliran input dan output mengalihkan, dan kitaran hayat proses kawalan, yang sesuai untuk alat automasi dan skrip penempatan; 3. Dari segi rangkaian dan kesesuaian, pakej bersih menyokong pengaturcaraan TCP/UDP, pertanyaan DNS dan set asal.

Bagaimanakah saya memanggil kaedah pada contoh struct di GO? Jun 24, 2025 pm 03:17 PM

Dalam bahasa Go, memanggil kaedah struktur memerlukan terlebih dahulu menentukan struktur dan kaedah yang mengikat penerima, dan mengaksesnya menggunakan nombor titik. Selepas menentukan segi empat tepat struktur, kaedah boleh diisytiharkan melalui penerima nilai atau penerima penunjuk; 1. Gunakan penerima nilai seperti kawasan func (rrectangle) int dan terus memanggilnya melalui rect.area (); 2. Jika anda perlu mengubah suai struktur, gunakan penerima penunjuk seperti func (R*segi empat) setWidth (...), dan GO akan secara automatik mengendalikan penukaran penunjuk dan nilai; 3. Apabila membenamkan struktur, kaedah struktur tertanam akan diperbaiki, dan ia boleh dipanggil secara langsung melalui struktur luar; 4. Pergi tidak perlu memaksa menggunakan getter/setter,

Apakah antaramuka dalam GO, dan bagaimana saya menentukannya? Jun 22, 2025 pm 03:41 PM

Di GO, antara muka adalah jenis yang mentakrifkan tingkah laku tanpa menentukan pelaksanaan. Antara muka terdiri daripada tandatangan kaedah, dan mana -mana jenis yang melaksanakan kaedah ini secara automatik memenuhi antara muka. Sebagai contoh, jika anda menentukan antara muka penceramah yang mengandungi kaedah bercakap (), semua jenis yang melaksanakan kaedah boleh dipertimbangkan pembesar suara. Antara muka sesuai untuk menulis fungsi umum, butiran pelaksanaan abstrak, dan menggunakan objek mengejek dalam ujian. Menentukan antara muka menggunakan kata kunci antara muka dan menyenaraikan tandatangan kaedah, tanpa secara jelas mengisytiharkan jenis untuk melaksanakan antara muka. Kes penggunaan biasa termasuk log, pemformatan, abstraksi pangkalan data atau perkhidmatan yang berbeza, dan sistem pemberitahuan. Sebagai contoh, kedua -dua jenis anjing dan robot boleh melaksanakan kaedah bercakap dan menyampaikannya kepada anno yang sama

Bagaimana saya menggunakan fungsi rentetan dari pakej Strings di GO? (mis., len (), strings.contains (), strings.index (), strings.replaceall ()) Jun 20, 2025 am 01:06 AM

Dalam bahasa Go, operasi rentetan terutamanya dilaksanakan melalui pakej rentetan dan fungsi terbina dalam. 1.Strings.Contains () digunakan untuk menentukan sama ada rentetan mengandungi substring dan mengembalikan nilai boolean; 2.Strings.index () boleh mencari lokasi di mana substring muncul untuk kali pertama, dan jika ia tidak wujud, ia kembali -1; 3.Strings.ReplaceAll () boleh menggantikan semua substrings yang sepadan, dan juga boleh mengawal bilangan pengganti melalui string.replace (); 4. Len () Fungsi digunakan untuk mendapatkan panjang bait rentetan, tetapi apabila memproses Unicode, anda perlu memberi perhatian kepada perbezaan antara aksara dan bait. Fungsi ini sering digunakan dalam senario seperti penapisan data, parsing teks, dan pemprosesan rentetan.

Bagaimana saya menggunakan pakej IO untuk berfungsi dengan aliran input dan output di GO? Jun 20, 2025 am 11:25 AM

TheGoioPackageProvidesInderFacesLikeReaderAndWritertohandlei/ooperatiationUniformlyAsssources.1.io.Reader'sReadmethodenablesreadingingfromvarioussourcessuchasfilesorhtpresponses.2.WriterSwriteShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileShacileS.

See all articles

国产av日韩一区二区三区精品,成人性爱视频在线观看,国产,欧美,日韩,一区,www.成色av久久成人,2222eeee成人天堂

Pemprosesan CSV Besar Menggunakan Go

Muat Dan Ekstrak Data

Mengumpulkan Jumlah Pelanggan kepada Setiap Bandar

Mengisih Jumlah Pelanggan Tertinggi

Kira Masa Pemprosesan

Hasilnya

Pengajaran

Apa yang terlintas di fikiran?

Alat AI Hot

Undress AI Tool

Undresser.AI Undress

AI Clothes Remover

Clothoff.io

Video Face Swap

Artikel Panas

Alat panas

Notepad++7.3.1

SublimeText3 versi Cina

Hantar Studio 13.0.1

Dreamweaver CS6

SublimeText3 versi Mac

Topik panas