🏠 Trang chủ
Benchmark
📊 Tất cả benchmark 🦖 Khủng long v1 🦖 Khủng long v2 ✅ Ứng dụng To-Do List 🎨 Trang tự do sáng tạo 🎯 FSACB - Trình diễn cuối cùng 🌍 Benchmark dịch thuật
Mô hình
🏆 Top 10 mô hình 🆓 Mô hình miễn phí 📋 Tất cả mô hình ⚙️ Kilo Code
Tài nguyên
💬 Thư viện prompt 📖 Thuật ngữ AI 🔗 Liên kết hữu ích

Thuật ngữ AI

Từ điển đầy đủ về Trí tuệ nhân tạo

162
danh mục
2.032
danh mục con
23.060
thuật ngữ
📖
thuật ngữ

Jailbreaking

Processus consistant à contourner intentionnellement les mécanismes de sécurité d'un modèle de langage pour le faire générer du contenu normalement restreint.

📖
thuật ngữ

RLHF

Méthode d'entraînement utilisant le reinforcement learning basé sur les retours humains pour aligner les comportements des LLM avec les préférences humaines.

📖
thuật ngữ

Red Teaming

Processus systématique de test des vulnérabilités des modèles par des équipes spécialisées simulant des attaques pour identifier les faiblesses de sécurité.

📖
thuật ngữ

Safety Layer

Couche de protection additionnelle intégrée aux LLM pour filtrer et modifier les sorties potentiellement dangereuses ou inappropriées avant leur génération finale.

📖
thuật ngữ

Content Moderation

Système automatisé de détection et de filtrage du contenu inapproprié, haineux ou dangereux dans les interactions avec les modèles de langage.

📖
thuật ngữ

Ethical Alignment

Processus visant à assurer que les décisions et comportements des IA respectent les principes éthiques fondamentaux et les normes sociétales acceptables.

📖
thuật ngữ

Value Alignment

Discipline cherchant à aligner les objectifs et comportements des systèmes d'IA avec les valeurs humaines complexes et souvent implicites.

📖
thuật ngữ

Guardrails

Mécanismes de contrôle préventifs et réactifs implantés dans les LLM pour limiter leur comportement dans des bornes sécurisées et éthiques prédéfinies.

📖
thuật ngữ

Output Filtering

Technique de post-traitement appliquée aux réponses générées par les LLM pour détecter et bloquer le contenu non conforme avant sa livraison à l'utilisateur.

📖
thuật ngữ

Constitutional Principles

Ensemble de règles fondamentales et explicites définissant les comportements acceptables et inacceptables pour un système d'IA, servant de cadre éthique opérationnel.

📖
thuật ngữ

Harmful Content Detection

Système de classification automatique identifiant les contenus potentiellement nuisibles, dangereux ou inappropriés dans les générations des modèles de langage.

📖
thuật ngữ

Bias Mitigation

Ensemble de techniques visant à réduire ou éliminer les biais systémiques présents dans les modèles d'IA pour assurer des réponses équitables et non discriminatoires.

📖
thuật ngữ

Safety Constraints

Limitations opérationnelles programmées dans les LLM pour empêcher la génération de contenu violant les politiques de sécurité ou les réglementations applicables.

📖
thuật ngữ

Preference Modeling

Processus d'apprentissage des préférences humaines complexes pour guider les modèles d'IA vers des comportements jugés souhaitables par les utilisateurs.

📖
thuật ngữ

Reward Hacking

Phénomène où les modèles optimisent leur fonction de récompense de manière littérale mais non intentionnelle, produisant des comportements indésirables mais récompensés.

📖
thuật ngữ

AI Safety Research

Domaine de recherche dédié au développement de méthodes et techniques pour garantir que les systèmes d'IA fonctionnent de manière sûre et bénéfique.

📖
thuật ngữ

Constitutional Supervision

Mécanisme de surveillance continue assurant que les modèles d'IA respectent en permanence les principes constitutionnels et les contraintes éthiques établies.

🔍

Không tìm thấy kết quả