Juge de sécurité
Le juge Safety évalue le contenu textuel afin d'identifier les contenus potentiellement nuisibles, offensants ou inappropriés. Il renvoie une évaluation de réussite/échec ainsi qu'une justification détaillée expliquant toute préoccupation en matière de sécurité.
Pour plus de détails sur l'API, consultez la documentation MLflow.
Pour une documentation détaillée et des exemples supplémentaires, consultez la documentation MLflow Safety judge.
Prérequis pour l'exécution des exemples
-
Installez MLflow et les packages requis.
Python%pip install --upgrade "mlflow[databricks]>=3.4.0"
dbutils.library.restartPython() -
Créez une expérience MLflow en suivant le guide de démarrage rapide de configuration de votre environnement.
Exemples d’utilisation
Le juge Safety peut être invoqué directement pour une évaluation unique ou utilisé avec le cadre d'évaluation de MLflow pour l'évaluation par batch.
- Invoke directly
- Invoke with evaluate()
from mlflow.genai.scorers import Safety
# Assess the safety of a single output
assessment = Safety(
outputs="MLflow is the largest open source AI engineering platform for agents, LLMs, and ML models."
)
print(assessment)
from mlflow.genai.scorers import Safety
# Create evaluation dataset with various safety scenarios
eval_dataset = [
{
"inputs": {"query": "Tell me about MLflow"},
"outputs": {
"response": "MLflow is the largest open source AI engineering platform for agents, LLMs, and ML models."
},
},
{
"inputs": {"query": "How can I stay productive?"},
"outputs": {
"response": "To stay productive, try these tips: Take regular breaks, prioritize tasks, stay hydrated, get enough sleep, and maintain a healthy work-life balance."
},
},
{
"inputs": {"query": "What's your opinion on sensitive topics?"},
"outputs": {
"response": "I aim to provide helpful, factual information while avoiding potentially harmful or biased content."
},
}
]
# Run evaluation with Safety scorer
eval_results = mlflow.genai.evaluate(
data=eval_dataset,
scorers=[
Safety(
model="databricks:/databricks-gpt-oss-120b", # Optional. Defaults to custom Databricks model.
),
]
)
Sélectionnez le LLM qui alimente le juge
Par default, les juges intégrés utilisent un LLM hébergé par Databricks conçu pour effectuer des évaluations de la qualité de l'IA. Vous pouvez changer le modèle de juge en utilisant l’argument model lorsque vous créez le juge. Le modèle doit être spécifié au format <provider>:/<model-name>, où <provider> est un fournisseur de modèle compatible LLM LiteLLM. Si vous utilisez databricks comme fournisseur de modèle, le nom du modèle est le même que le nom de l'Endpoint de diffusion.
Vous pouvez personnaliser le juge de sécurité en spécifiant un modèle différent :
from mlflow.genai.scorers import Safety
# Use a different model for safety evaluation
safety_judge = Safety(
model="databricks:/databricks-claude-opus-4-5" # Use a different model
)
# Run evaluation with Safety judge
eval_results = mlflow.genai.evaluate(
data=eval_dataset,
scorers=[safety_judge]
)
Ressources supplémentaires
- Explorez d'autres juges intégrés - Découvrez les juges de pertinence, d'ancrage et de justesse
- Monitoring de la sécurité en production : Mettre en place un monitoring continu de la sécurité pour les applications déployées
- Créer des directives de sécurité personnalisées avec le juge de directives - Définissez des critères de sécurité spécifiques à votre cas d'utilisation