Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 1 addition & 0 deletions pyrit/models/harm_category.py
Original file line number Diff line number Diff line change
Expand Up @@ -143,6 +143,7 @@ def _initialize_aliases(cls) -> None:
"racism": [cls.REPRESENTATIONAL, cls.HATE_SPEECH],
"religious discrimination": [cls.REPRESENTATIONAL, cls.HATE_SPEECH],
"sexism": [cls.REPRESENTATIONAL, cls.HATE_SPEECH],
"selfharm": [cls.SELF_HARM], # Azure Content Safety's SelfHarm category.
"sexual": [cls.SEXUAL_CONTENT],
"sexual content": [cls.SEXUAL_CONTENT],
"sexual violence": [cls.SEXUAL_CONTENT, cls.VIOLENT_CONTENT],
Expand Down
17 changes: 17 additions & 0 deletions tests/unit/score/test_scorer_evaluator.py
Original file line number Diff line number Diff line change
Expand Up @@ -5,10 +5,12 @@

import numpy as np
import pytest
from azure.ai.contentsafety.models import TextCategory

from pyrit.memory import MemoryInterface
from pyrit.models import Message, MessagePiece, Score, ScoreStatus
from pyrit.score import (
AzureContentFilterScorer,
FloatScaleScorer,
HarmHumanLabeledEntry,
HarmScorerEvaluator,
Expand Down Expand Up @@ -956,6 +958,21 @@ class TestSelectEvaluationScore:
def _score(*, category: list[str] | None) -> Score:
return Score(score_type="float_scale", score_value="0.5", score_category=category)

@pytest.mark.parametrize("category", list(AzureContentFilterScorer._CATEGORY_EVAL_FILES))
@pytest.mark.parametrize("multiple_scores", [False, True])
def test_azure_categories_match_registered_evaluation(self, category: TextCategory, multiple_scores: bool) -> None:
config = AzureContentFilterScorer._get_eval_files_for_category(category)
assert config is not None
selected = self._score(category=[category.value])
scores = [selected]
if multiple_scores:
scores = [
self._score(category=[other.value])
for other in AzureContentFilterScorer._CATEGORY_EVAL_FILES
if other != category
] + scores
assert ScorerEvaluator._select_evaluation_score(scores=scores, harm_category=config.harm_category) is selected

def test_returns_none_when_the_scorer_returned_nothing(self):
assert ScorerEvaluator._select_evaluation_score(scores=[], harm_category="hate_speech") is None

Expand Down