Gesaan dan konteks yang berkenaan
Anda bertanggungjawab ke atas aplikasi GenAI yang mendapatkan dokumen, memanggil model dan melaksanakan alatan. Pasukan perlu mengetahui versi model mana yang meningkatkan time to first token, sama ada alatan meningkatkan kegagalan, sama ada kos tertumpu pada beberapa penyewa (tenant), dan sama ada regresi kualiti boleh dimainkan semula (replay) tanpa mendedahkan data peribadi dalam gesaan. Reka bentuk surihan (traces), metrik, peristiwa dan get kualiti data menggunakan konvensyen semantik OpenTelemetry.
Ini adalah masalah pemodelan dan pengesahan data telemetri, bukan latihan pemilihan vendor. OpenTelemetry mentakrifkan konvensyen semantik sebagai nama atribut dan makna yang dikongsi merentas pangkalan kod, pustaka dan platform. Konvensyen GenAI merangkumi model, perbualan, panggilan alatan, penggunaan token dan penilaian, tetapi sesetengah bahagian masih berkembang, jadi bukan setiap atribut harus dianggap sebagai kontrak yang stabil.
Perkara yang dinilai oleh penemu duga
Penemu duga mahukan isyarat yang diperoleh daripada soalan perniagaan, bukannya log yang penuh dengan parameter model. Jawapan yang kukuh mengaitkan satu permintaan pengguna dengan kerja perolehan semula, model, alatan dan hasil akhir sambil mengekalkan dimensi versi dan penyewa yang mencukupi untuk menjelaskan regresi.
Anda mesti mentakrifkan sempadan data. Gesaan, respons, hujah alatan dan dokumen yang diperoleh semula mungkin mengandungi data sensitif; ID sesi berkardinaliti tinggi, ID pengguna atau kandungan penuh tidak boleh dijadikan label metrik tanpa had. Pengumpulan mesti mengimbangi privasi, kos penyimpanan, pensampelan dan pengekalan.
Akhir sekali, tentukan get kualiti. Jika span induk, versi model, sebab selesai (finish reason) atau kiraan token tiada, tandakan rekod sebagai tidak lengkap dan pantaunya daripada membentangkan papan pemuka yang kelihatan tepat tetapi mengelirukan.
Soalan penjelasan
Mula-mula tanya apakah hasil yang penting: time to first token, jumlah kependaman, kos setiap permintaan, kejayaan alatan, dapatan semula perolehan (recall) atau kualiti jawapan. Pilihan tersebut menentukan surihan, metrik dan peristiwa penilaian mana yang penting.
Kemudian tanya tentang sensitiviti dan bidang kuasa. Bolehkah gesaan dan respons disimpan? Adakah pengasingan serantau atau pemadaman peringkat penyewa diperlukan? Jika kandungan mentah dilarang, gunakan cincangan (hash), ringkasan yang disunting (redacted), ID rujukan dan main semula luar talian yang selamat.
Akhir sekali tanya tentang volum dan pengekalan. Kadar permintaan, kiraan panggilan model, kedalaman alatan, kadar pensampelan dan tempoh pengekalan menentukan pengumpul, baris gilir, pemetakan storan dan had kos.
Rangka kerja jawapan 30 saat
Anda boleh berkata:
“Saya akan memodelkan setiap permintaan pengguna sebagai satu surihan, dengan perolehan semula, penjanaan, panggilan alatan dan penilaian sebagai span anak atau peristiwa yang diversi. Metrik menggunakan dimensi berkardinaliti rendah seperti model, penyedia, aliran kerja dan keadaan hasil. Gesaan, respons dan hujah alatan disalurkan ke aliran peristiwa terkawal dengan penyuntingan, pensampelan dan akses yang diaudit. Setiap rekod diperiksa untuk korelasi surihan, susunan, versi model dan kiraan token; medan yang hilang menjadi kegagalan kualiti data. Papan pemuka menghubungkan kependaman, kos, ralat dan skor kualiti, manakala sampel permintaan tetap kekal tersedia untuk main semula yang selamat.”
Jawapan mendalam langkah demi langkah
Lakarkan graf isyarat hujung ke hujung
Span kemasukan merekodkan ID permintaan, ringkasan penyewa dan versi aliran kerja. Span perolehan semula merekodkan ID sumber, ringkasan pertanyaan dan kiraan hasil. Span model merekodkan penyedia, model permintaan, model respons, bendera penstriman, time to first token dan penggunaan token. Span alatan merekodkan jenis alatan, ID panggilan dan keadaan hasil. Peristiwa penilaian merekodkan nama penilai, skor dan rujukan penjelasan.
Gunakan dimensi metrik berkardinaliti rendah
Agregatkan kependaman, token, kos dan kejayaan mengikut model, penyedia, aliran kerja, rantau, keadaan hasil dan kelas ralat. Simpan ID sesi, ID pengguna, ID dokumen dan teks ralat penuh dalam surihan atau peristiwa dan bukannya label metrik untuk mengelakkan letupan siri masa.
Asingkan peristiwa kandungan daripada metrik masa jalanan
Panduan GenAI OpenTelemetry menerangkan surihan, metrik dan peristiwa sebagai tiga isyarat. Gesaan dan respons sesuai untuk aliran peristiwa kerana ia besar, sensitif dan tertakluk kepada pengekalan yang berbeza. Metrik masa jalanan menyimpan kiraan, kependaman dan kos; peristiwa kandungan menggunakan storan terkawal, penyulitan dan pengekalan yang lebih pendek.
Rekod versi dan kausaliti
Setiap span merekodkan versi model, templat gesaan, peroleh semula (retriever), takrifan alatan dan penilai. Siasatan regresi mesti menghubungkan skor kepada permintaan model yang tepat dan versi data input; satu nama model tidak dapat membezakan hanyutan alias, perubahan penghalaan dan perubahan gesaan.
Kawal pensampelan dan kos
Simpan surihan lengkap pada kadar tetap, kemudian tingkatkan pensampelan untuk ralat, kependaman melampau, skor rendah dan versi baharu. Agregatkan kiraan token dan panggilan alatan dalam masa nyata; kuat kuasakan belanjawan penyewa dengan pendikit (throttling) atau penurunan gred perkhidmatan. Peraturan pensampelan tergolong dalam metadata kualiti supaya perbandingan antara versi kekal sah.
Terapkan kawalan privasi dan akses
Sunting medan pada SDK atau pengumpul supaya kata laluan, data peribadi dan kunci tidak pernah memasuki atribut. Berikan autorisasi kepada peristiwa kandungan secara berasingan daripada metrik masa jalanan, menggunakan skop penyewa, rujukan disulitkan dan indeks pemadaman. Alasan «dalaman sahaja» bukanlah justifikasi untuk mengekalkan kandungan sensitif.
Sahkan kesempurnaan dan susunan
Semak hubungan induk-anak, cap masa monotonik, keadaan selesai, versi model dan ID panggilan alatan untuk setiap surihan. Bagi metrik, semak unit, sempadan baldi (bucket), pembilang monotonik dan laporan pendua. Bagi peristiwa, semak versi skema, keadaan penyuntingan dan had saiz. Hantar kegagalan ke baris gilir data buruk dengan kod sebab.
Hubungkan kualiti melalui peristiwa penilaian
Peristiwa penilaian mengandungi nama penilai, skor, label dan rujukan penjelasan. Jangan anggap skor automatik sebagai kebenaran mutlak; rekod versi penilai dan set data serta sampel manusia. Regresi kualiti harus disemak bersama-sama dengan kependaman, kos dan ralat daripada hanya mengoptimumkan satu isyarat sahaja.
Contoh jawapan berkualiti tinggi
“Saya akan mewakili setiap permintaan sebagai surihan yang berkorelasi: kemasukan, perolehan semula, model, alatan dan penilaian adalah span atau peristiwa yang diversi. Metrik menggunakan dimensi berkardinaliti rendah bagi model, penyedia, aliran kerja dan hasil untuk mengagregatkan time to first token, jumlah kependaman, token, kos dan ralat. Gesaan, respons dan hujah alatan disalurkan ke aliran kandungan yang disunting dan diaudit aksesnya berbanding label metrik. Lapisan pengumpulan menyemak pautan induk-anak, susunan, skema, versi model dan kiraan token; rekod yang tidak sah masuk ke baris gilir data buruk. Surihan lengkap disampelkan secara tetap, manakala ralat, permintaan perlahan dan regresi kualiti menerima lebih banyak pensampelan. Papan pemuka menggabungkan metrik masa jalanan kepada skor penilaian dan data main semula menggunakan versi set data dan penilai.”
Kesilapan biasa
Meletakkan semua kandungan dalam label metrik
Corak kegagalan: menggunakan ID pengguna, ID sesi atau gesaan penuh sebagai label. Mengapa ia gagal: kardinaliti tinggi boleh membebankan storan dan pertanyaan sambil meningkatkan pendedahan privasi. Pembetulan: pastikan metrik berkardinaliti rendah dan letakkan kandungan dalam peristiwa terkawal.
Hanya merekodkan nama model
Corak kegagalan: membandingkan setiap hasil dengan satu medan nama model. Mengapa ia gagal: penghalaan alias, templat gesaan, peroleh semula dan versi alatan menjadi tidak dapat dibezakan. Pembetulan: rekod model permintaan, model respons, aliran kerja dan versi kebergantungan.
Mengoptimumkan kos token semata-mata
Corak kegagalan: mengisytiharkan kejayaan apabila kos menurun. Mengapa ia gagal: time to first token, kejayaan alatan atau kualiti jawapan mungkin merosot. Pembetulan: pantau kos, kependaman, ralat, perolehan semula dan penilaian secara bersama.
Menyimpan gesaan dan respons mentah
Corak kegagalan: mengekalkan teks mentah selama-lamanya untuk main semula. Mengapa ia gagal: kandungan boleh merangkumi data peribadi, kunci atau maklumat rentas penyewa. Pembetulan: sunting medan, gunakan pengekalan singkat, rujukan disulitkan, akses penyewa dan indeks pemadaman.
Mengabaikan data buruk
Corak kegagalan: memasukkan rekod dengan induk atau kiraan token yang hilang dalam penyebut. Mengapa ia gagal: papan pemuka kelihatan lengkap tetapi tidak dapat menerangkan nombornya. Pembetulan: tentukan get kesempurnaan, baris gilir data buruk dan papan pemuka kualiti yang membezakan data yang hilang daripada sifar sebenar.
Soalan susulan dan respons
Bagaimana jika pasukan meminta untuk merekodkan keseluruhan proses penaakulan (reasoning process)?
Jelaskan sama ada perniagaan memerlukan bukti yang boleh diaudit, surihan alatan atau penaakulan model dalaman. Utamakan rujukan input, panggilan alatan, versi, bukti penilaian dan ringkasan hasil; jangan simpan kandungan sensitif yang tidak perlu atau teks penaakulan dalaman.
Bagaimana jika konvensyen GenAI berhijrah?
Simpan versi skema dalam pengumpul dan gudang data, petakan medan lama kepada baharu, dan gunakan penulisan dwi (dual writes) atau paparan keserasian semasa penghijrahan. Kumpulkan papan pemuka mengikut versi konvensyen dan bukannya mencampurkan maknanya.
Bagaimana jika trafik puncak menjadikan surihan lengkap terlalu mahal?
Simpan surihan lengkap untuk ralat dan kependaman melampau, sampel trafik normal pada kadar tetap, dan kekalkan metrik agregat serta ringkasan peristiwa. Rekod kadar pensampelan, peraturan pencetus dan sebab pengguguran sebagai metadata kualiti.
Bagaimana jika skor penilaian menurun manakala kependaman bertambah baik?
Hiris mengikut model, templat gesaan, set data perolehan semula, versi alatan dan penyewa, serta sahkan bahawa set data dan penilai tidak berubah. Biarkan get pelepasan menimbang regresi kualiti berbanding peningkatan prestasi daripada hanya menerima satu metrik.
Bagaimanakah anda membuktikan surihan tidak merentasi sempadan penyewa?
Jalankan ujian sempadan penyewa pada lapisan pengumpulan, pengangkutan, storan dan pertanyaan. Data sintetik harus mengesahkan skop penyewa pada atribut, peristiwa dan rujukan; pertanyaan anomali mengeluarkan amaran audit. Permintaan pemadaman mesti dapat mencari setiap peristiwa terbitan melalui indeks.