Aliran balik log mengonversi log inferensi SLS (Simple Log Service) menjadi dataset terstruktur yang dapat digunakan untuk penyempurnaan model atau evaluasi model.
Ikhtisar fitur
Fitur aliran balik log mengalirkan kembali data log inferensi dari SLS (Simple Log Service) ke platform Bailian, memformatnya, dan menghasilkan dataset terstruktur (dalam format JSONL) yang dapat digunakan untuk penyempurnaan model atau evaluasi model. Aliran balik ini menghasilkan data terstruktur, bukan salinan langsung dari log mentah.
Cakupan
Aliran balik log mendukung pembuatan dua jenis dataset berikut:
- Training set: Skenario pelatihan adalah generasi teks, dan metode pelatihan mendukung SFT (Supervised Fine-Tuning).
- Evaluation set: Mendukung skenario generasi teks.
Aliran balik log saat ini hanya tersedia di wilayah China (Beijing) dan Singapore. Entri aliran balik log tidak ditampilkan di wilayah lain. Batas atas untuk satu kali aliran balik adalah 100.000 entri, dan Anda dapat melakukan aliran balik beberapa kali ke versi berbeda dari dataset yang sama untuk mengumpulkan lebih banyak data.
Aliran balik log mendukung dua metode penyimpanan: Platform Storage (default) . Untuk perbedaan antara metode penyimpanan dan panduan pemilihan, lihat Buat dataset aliran balik log.
Dataset yang dihasilkan melalui aliran balik dapat langsung digunakan untuk tugas downstream: training set dapat digunakan untuk penyempurnaan model, dan evaluation set dapat digunakan untuk evaluasi model.
Aktifkan dan otorisasi layanan terkait
Sebelum menggunakan aliran balik log, pastikan wilayah saat ini adalah China (Beijing) atau Singapore (entri aliran balik log tidak ditampilkan di wilayah lain), dan selesaikan aktivasi layanan serta otorisasi izin berikut pada halaman Pemantauan model. Setelah semua langkah selesai, panel konfigurasi otorisasi akan otomatis tertutup dan Anda akan masuk ke formulir aliran balik log.
Aktifkan log audit dan log inferensi
Log audit dan log inferensi masing-masing memerlukan tiga langkah yang harus diselesaikan. Anda hanya dapat menggunakan aliran balik log setelah keenam kondisi terpenuhi. Log audit merupakan prasyarat untuk log inferensi, sehingga Anda harus menyelesaikan semua langkah log audit terlebih dahulu.
Log audit- Otorisasi peran terkait layanan SLS: Klik Authorize Now untuk mengotorisasi peran AliyunServiceRoleForSFMAccessSLS. Jika belum diotorisasi, label merah Not Authorized akan ditampilkan.
- Aktifkan Layanan Log SLS: Jika belum diaktifkan, status Not Activated dan tautan pengalihan akan ditampilkan. Klik tautan tersebut untuk membuka konsol SLS dan menyelesaikan aktivasi.
- Aktifkan log audit: Klik Create and Enable Audit Logs, dan sistem akan membuat instans LogStore serta melakukan polling hingga siap (maksimal 60 detik).
- Otorisasi peran terkait layanan SLS untuk log inferensi.
- Pastikan Layanan Log SLS telah diaktifkan.
- Aktifkan log inferensi: Jika log audit belum diaktifkan, tombol ini akan dinonaktifkan. Anda harus mengaktifkan log audit terlebih dahulu.
ImportantAktivasi harus mengikuti urutan ini: log audit terlebih dahulu, lalu log inferensi. Penonaktifan harus mengikuti urutan terbalik: nonaktifkan log inferensi terlebih dahulu, lalu log audit. Setelah log dinonaktifkan, data yang ada tidak dapat dipulihkan. Pastikan Anda tidak lagi membutuhkan data log sebelum melakukan operasi ini. Setelah log inferensi diaktifkan, SLS akan terus dikenai biaya penyimpanan dan baca/tulis. Nonaktifkan jika tidak lagi diperlukan.
Tabel berikut merangkum peran terkait layanan yang terlibat dalam aliran balik log.
Nama peran | Tujuan | Waktu otorisasi |
|---|---|---|
AliyunServiceRoleForSFMAccessSLS | Bailian mengakses data log SLS | Diotorisasi sekali untuk log audit dan sekali untuk log inferensi |
Buat dataset aliran balik log
Aliran balik log menyediakan tiga titik masuk, semuanya mengarah ke formulir konfigurasi untuk membuat dataset:
Halaman daftar Pemantauan model
Di bagian atas Monitoring halaman daftar, klik Log Ingestion. Untuk penggunaan pertama kali, selesaikan konfigurasi otorisasi terlebih dahulu. Setelah otorisasi berhasil, formulir aliran balik log akan ditampilkan secara otomatis.

Halaman detail Pemantauan model
Di area pemilih waktu pada halaman detail pemantauan model, klik Log Ingestion. Saat memasuki formulir dari titik masuk ini, rentang waktu, API Key, dan model halaman saat ini akan diisi otomatis, dan model tidak dapat diubah.
Halaman manajemen data
Saat membuat dataset baru pada halaman Data management, pilih Log Backflow sebagai metode impor. Opsi ini hanya terlihat untuk training set (generasi teks + SFT) atau evaluation set (generasi teks).
Konfigurasi parameter aliran balik
Setelah memasuki formulir aliran balik log, konfigurasikan parameter berikut dari atas ke bawah. Beberapa parameter memiliki prasyarat: pemfilteran API Key memerlukan pemilihan rentang waktu terlebih dahulu, dan pemilihan model memerlukan pemilihan rentang waktu dan API Key terlebih dahulu. Mengubah rentang waktu, tipe data, skenario pelatihan, atau metode pelatihan akan mengatur ulang parameter lain secara berjenjang, sehingga disarankan untuk mengisi formulir secara ketat sesuai urutan. Nilai parameter dijelaskan dalam tabel di bawah ini.
Estimated backflow data: Sistem menampilkan perkiraan jumlah entri data aliran balik berdasarkan kondisi filter. Ketika jumlah melebihi 100.000, peringatan merah akan ditampilkan, dan kelebihannya tidak akan dialirkan balik. Ketika hasil kueri terlalu banyak, tombol OK akan dinonaktifkan, dan Anda perlu mempersempit rentang filter.
NoteAturan pengaturan ulang berjenjang formulir: Mengubah rentang waktu akan mengatur ulang API Key (kembali ke All) dan pemilihan model (dikosongkan); mengubah tipe data, skenario pelatihan, atau metode pelatihan akan mengatur ulang lokasi penyimpanan dan metode impor.
ImportantMetode penyimpanan, tipe data, dan metode pelatihan tidak dapat diubah setelah pembuatan. Pastikan dengan cermat sebelum memilih.
Parameter | Deskripsi | Wajib | Deskripsi nilai |
|---|---|---|---|
Lokasi aliran balik | Metode penyimpanan dataset | Ya | Platform storage (default). Tidak dapat diubah setelah pembuatan |
Nama dataset | Nama tampilan dataset dalam daftar | Ya | Nama hanya boleh terdiri dari karakter Mandarin, Inggris, angka, underscore (_), garis miring (/), dan tanda hubung (-), dengan panjang maksimal 50 karakter. Format penamaan yang direkomendasikan: function_scenario_model_name_time. Nama tidak dapat diubah setelah dibuat. |
Deskripsi dataset | Deskripsi tambahan mengenai tujuan dataset | Tidak | Maksimal 200 karakter |
Tipe dan format | Tipe tujuan dataset | Ya | Training set atau evaluation set. Saat evaluation set dipilih, skenario pelatihan dan metode pelatihan disembunyikan. Tidak dapat diubah setelah pembuatan |
Skenario pelatihan | Tipe skenario pelatihan (ditampilkan hanya untuk training set) | Ya | Saat ini hanya generasi teks yang didukung |
Metode pelatihan | Metode penyempurnaan (ditampilkan hanya untuk training set) | Ya | SFT; opsi ditampilkan secara dinamis oleh sistem. Dikunci setelah pembuatan |
Rentang waktu | Periode waktu log aliran balik | Ya | 30 hari terakhir (termasuk hari ini), presisi hingga jam, menit, dan detik. Mengubahnya akan mengatur ulang pemilihan API Key dan model |
Filter API Key | Memfilter data log berdasarkan API Key | Ya | All (tanpa filter), Other (mengecualikan Key yang terdaftar), atau pilih Key tertentu (multi-pilih) |
Pemilihan model | Model target untuk aliran balik | Ya | Maksimal 10. Model yang tidak sesuai dengan filter tipe kemampuan akan dinonaktifkan |
Lihat hasil aliran balik
Setelah mengirimkan tugas aliran balik log, lihat dataset dan progres impor pada Data management halaman daftar.
Tampilan halaman daftar
Dataset yang dibuat melalui aliran balik log menampilkan metode impor sebagai Log Ingestion pada halaman daftar, dan lokasi penyimpanan ditampilkan sebagai Platform Storage berdasarkan pilihan saat pembuatan.
Anda dapat melihat status impor tugas pada halaman daftar. Saat tugas gagal, Anda dapat melihat alasan kegagalan spesifik yang dikembalikan oleh sistem.
Dalam mode penyimpanan platform, sistem secara otomatis menerbitkan versi dataset setelah impor selesai, tanpa memerlukan operasi manual.
Informasi halaman detail
Informasi yang ditampilkan pada halaman detail dataset bervariasi tergantung pada metode penyimpanan:
- Platform storage (OSS import): Menampilkan status rilis, volume data, waktu pembuatan, FileID, tipe data, status impor, dan alamat impor OSS.
- Kasus lainnya: Menampilkan status rilis, volume data, waktu pembuatan, FileID, tipe data, dan status impor.
Tambahkan data aliran balik log
Pada halaman Manajemen data, Anda dapat menambahkan batch baru data aliran balik log ke dataset yang sudah ada dengan dua cara berikut:
Halaman impor data
Masuk ke halaman Import data dataset yang sudah ada dan pilih Log Backflow sebagai metode impor. Parameter formulir sama dengan alur pembuatan. Untuk detailnya, lihat Buat dataset aliran balik log. Metode ini juga mendukung pemfilteran berdasarkan ruang kerja.
Metode ini berlaku untuk semua tipe penyimpanan dataset.
Dialog tambah versi
Pada halaman detail dataset, klik New Version, dan pilih metode impor aliran balik log dalam dialog. Metode ini hanya tersedia untuk dataset penyimpanan platform.
Praktik terbaik aliran balik inkremental
Disarankan untuk melakukan aliran balik secara bertahap, menargetkan periode waktu berbeda atau model berbeda secara terpisah, dan secara bertahap mengumpulkan training set berkualitas tinggi. Setiap batch dapat memilih secara tepat model dengan performa baik dan data dari jam sibuk bisnis, memastikan kualitas data lebih unggul dibandingkan aliran balik besar tunggal.
FAQ
Apa saja permintaan yang termasuk dalam "Other" pada filter API Key?
Pertanyaan: Permintaan apa saja yang termasuk dalam Other pada filter API Key?
Other menyaring permintaan dari Key yang terdaftar, termasuk Key yang telah dihapus atau log yang dihasilkan oleh ruang kerja lain. All tidak melakukan pemfilteran berdasarkan Key. Untuk deskripsi lengkap ketiga mode (All/Other/pemilihan individual), lihat parameter filter API Key dalam Buat dataset aliran balik log.
Apakah batas 100.000 entri merupakan batas total dataset?
Pertanyaan: Batas aliran balik tunggal adalah 100.000 entri. Apakah ini berarti volume total dataset juga dibatasi hingga 100.000 entri?
Tidak. Batas 100.000 entri berlaku untuk satu kali aliran balik, bukan volume total dataset. Anda dapat melakukan aliran balik beberapa kali ke versi berbeda dari dataset yang sama, dan volume data kumulatif tidak tunduk pada batas ini. Misalnya, dengan melakukan aliran balik bertahap untuk periode waktu berbeda, masing-masing dalam batas 100.000 entri, dataset akhir dapat mengumpulkan jauh lebih dari 100.000 entri data.
Apakah log audit dan log inferensi merupakan operasi yang sama?
Pertanyaan: Mengaktifkan log memerlukan operasi terpisah untuk log audit dan log inferensi. Apa hubungan di antara keduanya?
Keduanya harus diaktifkan secara terpisah, dan log audit harus diselesaikan terlebih dahulu sebelum log inferensi dapat diaktifkan. Untuk langkah-langkah operasi, lihat Aktifkan dan otorisasi layanan terkait.
Mengapa volume data perkiraan tidak konsisten dengan hasil aliran balik aktual?
Pertanyaan: Volume data perkiraan yang ditampilkan sebelum pengiriman berbeda dengan jumlah entri aktual setelah aliran balik selesai.
Volume data perkiraan merupakan nilai perkiraan berdasarkan kondisi filter. Jumlah entri data aktual setelah aliran balik mungkin sedikit berbeda, yang merupakan hal normal. Perkiraan ini digunakan untuk membantu menentukan apakah kondisi filter perlu disesuaikan (misalnya, ketika melebihi 100.000 entri, Anda diminta untuk mempersempit rentang) dan tidak mewakili jumlah pasti.