Model ve prompt sınırı
Doğrudan ve dolaylı talimatların model/uygulama kontrolüyle nasıl etkileştiğini inceleme.
- Prompt ve dolaylı enjeksiyon
- Güvenli başarısızlık
- Çıktı işleme sınırı
AI sistemi güvenliği
LLM, RAG, bellek, araç, ajan ve insan onayının oluşturduğu güven sınırlarını ayrı ayrı görünür kılmayı hedefleyen araştırma önizlemesi.
Alıcı problemi
Veri kaynağı, retrieval, kalıcı bellek, araç yetkisi ve çok adımlı ajan davranışı tek bir sistem oluşturur. Bu nedenle AI kullanarak geleneksel uygulama testi yapmak ile hedef AI sistemini red team etmek ayrı kapsamlar olarak ele alınır.
Sistem sınırlarının görünür hale gelmesi
Kötüye kullanım hipotezlerinin önceliklendirilmesi
İnsan onayı ve araç yetkisi için tasarım girdisi
Örnek kapsam
Senaryolar, yazılı yetki ve sentetik test verisiyle sınırlandırılır. Aşağıdaki kategoriler araştırma matrisi adaylarıdır; eksiksiz kapsama sözü değildir.
Doğrudan ve dolaylı talimatların model/uygulama kontrolüyle nasıl etkileştiğini inceleme.
Kaynak güveni, hassas veri ayrımı ve kalıcı bağlamın kötüye kullanım risklerini modelleme.
Amaç, kimlik, araç çağrısı ve insan onayının çok adımlı davranıştaki rolünü inceleme.
Teslimat sınırı
Hizmet sayfasındaki içerik bir fiyat, SLA veya kesin kapsam teklifi değildir. Çalışma koşulları ve kullanılabilirlik sınırı yazılı kapsam kaydında netleşir.
Yayın kapısı
Bu liste bir eksiklik saklamaz; hizmetin hangi doğrulamalardan sonra üst olgunluk düzeyine taşınabileceğini görünür kılar.
OWASP, NIST ve MITRE referanslı tekrarlanabilir test matrisi
Çok adımlı, stateful ve araç kullanan güvenli laboratuvar senaryoları
Karşı-test, iş etkisi ve yeniden üretilebilir trace standardı
Model/uygulama sınırı ile veri yönetişimi prosedürü
Anonim örnek rapor ve kontrollü teslimat provası
Metodoloji kaynakları
Bu kaynaklar OYI için sertifika, resmî onay veya eksiksiz kapsam iddiası değildir.
Ajan, araç, bellek, kimlik ve amaç sınırları için risk taksonomisi
Test kapsamı için referanstır; uyum veya kapsama garantisi değildir.NIST AMLAdversarial machine learning saldırı ve azaltım taksonomisi
Ortak dil sağlar; ticari hizmet doğrulaması yerine geçmez.MITRE ATLASAI sistemlerine yönelik adversarial taktik ve teknik bilgi tabanı
Tehdit modelleme referansıdır; resmî onay anlamına gelmez.Varlık, risk, veri ve olgunluk gereksinimlerini konuşalım; uygun değilse bunu da ilk görüşmede açıkça belirleyelim.