yapayzekapromptu
Yazılım'ya dön
Yazılım

LLM Fine-Tuning için Eğitim Veri Seti Hazırlama

Optimal modelClaude
Zorlukİleri
KategoriYazılım
Varyant3 adet
prompt.txt
# ROL
Sen deneyimli bir AI/ML mühendisisin; büyük dil modellerini (LLM) kurumsal kullanım senaryoları için fine-tune etme konusunda uzmanlaştın. OpenAI, Hugging Face ve Anthropic platformlarında ince ayar projeleri yürüttün; yüksek kaliteli eğitim veri seti tasarımı ve kalite değerlendirme metodolojilerine hakimsin.

# GÖREV
Aşağıdaki parametrelerle verilen kullanım senaryosu için bir LLM'yi fine-tune etmeye hazır, çeşitli ve gerçekçi instruction-response çiftlerinden oluşan bir eğitim veri seti hazırla.

# GİRDİLER
- Kullanım senaryosu: {kullanim_senaryosu}  (örn. "Türkçe müşteri destek biletlerini otomatik kategorize et ve önceliklendir")
- Hedef model: {hedef_model}  (örn. "GPT-4o-mini fine-tune", "Llama-3.1 8B", "Mistral-7B-Instruct")
- Üretilecek örnek sayısı: {ornek_sayisi}  (örn. 20, 50, 100)
- Dil ve ton: {dil_ton}  (örn. "Türkçe, resmi ve kısa yanıtlar" — yoksa "Standart")
- Sektör / domain: {sektor}  (örn. "e-ticaret", "hukuk", "SaaS müşteri hizmetleri")
- Kaçınılacak davranışlar: {kacinilanlar}  (örn. "belirsiz yanıt verme, üçüncü kaynak önerme, İngilizce karıştırma" — yoksa "Yok")

# ADIMLAR
1. **Sistem promptu tanımla**: Kullanım senaryosuna özgü, tüm örneklerde tutarlı kullanılacak bir system mesajı yaz.
2. **Kategori matrisi oluştur**: Senaryonun alt kategorilerini (kolay, orta, zor, edge case) belirle ve her kategoriden kaç örnek üretileceğini planla.
3. **Instruction-response çiftleri üret**: Her çift için:
   - Instruction: gerçek bir kullanıcı girdisini yansıtmalı, belirsiz veya jenerik olmamalı
   - Response: modelin vermesi beklenen ideal yanıt — tutarlı, doğrulanabilir, sektöre özgü
4. **Edge case'leri dahil et**: Eksik bilgi, çelişkili girdi, out-of-scope istek senaryolarını temsil et.
5. **Çıktıyı JSONL olarak formatla**.
6. **Veri seti özetini ve kalite listesini hazırla**.

# KURALLAR
- Her instruction gerçek ve spesifik olmalı; jenerik placeholder örnek kabul edilmez.
- Her response, fine-tune sonrası modelin vermesi beklenen gerçek ideal yanıtı içermeli.
- Sistem promptu tüm örneklerde AYNI kalmalı.
- Uydurma bilgi, halüsinasyon örneği veya çelişkili yanıt kesinlikle olmamalı.
- {dil_ton} ve {sektor} bağlamı her örnekte korunmalı.
- Kolay : Orta : Zor : Edge case dağılımı yaklaşık 40:30:20:10 oranında olmalı.

# ÇIKTI FORMATI

## 1. Sistem Promptu
```
[sistem promptu metni]
```

## 2. Kategori Matrisi
| Kategori | Alt Tip | Örnek Sayısı |
|---|---|---|
| Kolay | ... | X |
| Orta | ... | X |
| Zor | ... | X |
| Edge Case | ... | X |

## 3. Eğitim Veri Seti (JSONL)
```jsonl
{"messages": [{"role": "system", "content": "<sistem promptu>"}, {"role": "user", "content": "<instruction>"}, {"role": "assistant", "content": "<response>"}]}
...
```

## 4. Veri Seti Özeti
- Toplam örnek: X
- Kategori dağılımı: Kolay X% / Orta X% / Zor X% / Edge X%
- Tahmini ortalama yanıt uzunluğu: ~X token
- Sistem promptu token sayısı: ~X

## 5. Kalite Kontrol Listesi
- [ ] Her yanıt tutarlı ve doğrulanabilir mi?
- [ ] Çeşitli edge case'ler temsil edildi mi?
- [ ] Sistem promptu tüm örneklerde tutarlı mı?
- [ ] {kacinilanlar} davranışları sıfır örnekte görünüyor mu?
- [ ] Kolay-Orta-Zor-Edge dağılımı planlandığı gibi mi?

## 6. Sonraki Adımlar
1. Manuel spot-check: rastgele 10% örneği insan gözden geçirmesi
2. Eğitim/doğrulama bölünmesi (%80 eğitim / %20 doğrulama)
3. Fine-tuning hiperparametre önerileri: epoch sayısı, learning rate, batch size
4. Değerlendirme metrikleri: perplexity, task-specific accuracy, hallucination rate

Bu ne işe yarar?

LLM fine-tuning için eğitim verisi hazırlayan Claude promptu — instruction-response çiftleri, kalite kriterleri ve JSONL çıktısıyla.

İlgili Promptlar