

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# 점수 정의
<a name="guardrails-use-invoke-guardrail-checks-scores"></a>

## 심각도 점수(콘텐츠 필터 및 프롬프트 공격 탐지용)
<a name="guardrails-use-invoke-guardrail-checks-severity-score"></a>

콘텐츠 필터와 프롬프트 공격 감지를 사용하면 API가 심각도 점수를 반환합니다. 심각도 점수는 안전 검사 기준과 가장 일치하는 범위를 나타내는 [0, 1]의 숫자 값입니다. 이러한 점수는 별개이며 가능한 값은 0, 0.2, 0.4, 0.6, 0.8 및 1.0입니다.

1점(최대)은 가장 강력한 일치 항목으로, 안전 검사 정의와 가장 근접한 일치 항목입니다. 0점(최소값)은 가장 약한 일치 항목으로, 콘텐츠가 양호함을 나타냅니다.

심각도 점수는 분류에 대한 기본 모델의 확실성이 아니라 콘텐츠 자체의 속성입니다. "이 콘텐츠는 안전 점검 기준과 얼마나 일치합니까?"라는 질문에 답합니다. "기저 모델이 얼마나 확실합니까?"라고 답하지 않습니다. 다음 표에서는이 정의를 자세히 설명합니다.


**보호 장치의 심각도 점수 의미**  

| Safeguard | 세부 수준 | 심각도 점수의 의미 | 
| --- | --- | --- | 
| 콘텐츠 필터 | 범주별(HATE, VIOLENCE, INSULTS, SEXUAL, MISCONDUCT) | 콘텐츠가 각 범주의 유해한 콘텐츠와 얼마나 일치합니까? | 
| 프롬프트 공격 | 공격 벡터당(JAILBREAK, PROMPT\_INJECTION, PROMPT\_LEAKAGE) | 콘텐츠가 각 공격 벡터와 얼마나 일치하는가? | 

점수 자체는 콘텐츠를 차단하지 않습니다. 점수를 임계값으로 사용하여 애플리케이션이 얼마나 제한적인지 제어합니다.

## 신뢰도 점수(민감한 정보 필터의 경우)
<a name="guardrails-use-invoke-guardrail-checks-confidence-score"></a>

민감한 정보 필터를 사용하면 API는 모델이 PII 개체가 존재하는지 얼마나 확신하는지를 나타내는 신뢰도 점수를 반환합니다. 이 점수는 PII 탐지와 관련이 있으며 API를 호출할 때 선택한 PII 엔터티의 존재에 대한 모델의 신뢰도를 반영합니다.