🏠 首页
基准测试
📊 所有基准测试 🦖 恐龙 v1 🦖 恐龙 v2 ✅ 待办事项应用 🎨 创意自由页面 🎯 FSACB - 终极展示 🌍 翻译基准测试
模型
🏆 前 10 名模型 🆓 免费模型 📋 所有模型 ⚙️ 🛠️ 千行代码模式
资源
💬 💬 提示库 📖 📖 AI 词汇表 🔗 🔗 有用链接

AI 词汇表

人工智能完整词典

200
个类别
2,608
个子类别
30,011
个术语
📖
个术语

Jailbreaking

Processus consistant à contourner intentionnellement les mécanismes de sécurité d'un modèle de langage pour le faire générer du contenu normalement restreint.

📖
个术语

RLHF

Méthode d'entraînement utilisant le reinforcement learning basé sur les retours humains pour aligner les comportements des LLM avec les préférences humaines.

📖
个术语

Red Teaming

Processus systématique de test des vulnérabilités des modèles par des équipes spécialisées simulant des attaques pour identifier les faiblesses de sécurité.

📖
个术语

Safety Layer

Couche de protection additionnelle intégrée aux LLM pour filtrer et modifier les sorties potentiellement dangereuses ou inappropriées avant leur génération finale.

📖
个术语

Content Moderation

Système automatisé de détection et de filtrage du contenu inapproprié, haineux ou dangereux dans les interactions avec les modèles de langage.

📖
个术语

Ethical Alignment

Processus visant à assurer que les décisions et comportements des IA respectent les principes éthiques fondamentaux et les normes sociétales acceptables.

📖
个术语

Value Alignment

Discipline cherchant à aligner les objectifs et comportements des systèmes d'IA avec les valeurs humaines complexes et souvent implicites.

📖
个术语

Guardrails

Mécanismes de contrôle préventifs et réactifs implantés dans les LLM pour limiter leur comportement dans des bornes sécurisées et éthiques prédéfinies.

📖
个术语

Output Filtering

Technique de post-traitement appliquée aux réponses générées par les LLM pour détecter et bloquer le contenu non conforme avant sa livraison à l'utilisateur.

📖
个术语

Constitutional Principles

Ensemble de règles fondamentales et explicites définissant les comportements acceptables et inacceptables pour un système d'IA, servant de cadre éthique opérationnel.

📖
个术语

Harmful Content Detection

Système de classification automatique identifiant les contenus potentiellement nuisibles, dangereux ou inappropriés dans les générations des modèles de langage.

📖
个术语

Bias Mitigation

Ensemble de techniques visant à réduire ou éliminer les biais systémiques présents dans les modèles d'IA pour assurer des réponses équitables et non discriminatoires.

📖
个术语

Safety Constraints

Limitations opérationnelles programmées dans les LLM pour empêcher la génération de contenu violant les politiques de sécurité ou les réglementations applicables.

📖
个术语

Preference Modeling

Processus d'apprentissage des préférences humaines complexes pour guider les modèles d'IA vers des comportements jugés souhaitables par les utilisateurs.

📖
个术语

Reward Hacking

Phénomène où les modèles optimisent leur fonction de récompense de manière littérale mais non intentionnelle, produisant des comportements indésirables mais récompensés.

📖
个术语

AI Safety Research

Domaine de recherche dédié au développement de méthodes et techniques pour garantir que les systèmes d'IA fonctionnent de manière sûre et bénéfique.

📖
个术语

Constitutional Supervision

Mécanisme de surveillance continue assurant que les modèles d'IA respectent en permanence les principes constitutionnels et les contraintes éthiques établies.

🔍

未找到结果