테크 프레스
LLM의 근본적 약점 '역할 식별 오류', Chain-of-Thought Forgery 공격에 무방비
대언어모델들이 명령의 출처를 제대로 구분하지 못해서, 그 방식을 흉내내면 누구든 위험한 정보를 뽑아낼 수 있다는 거예요
MIT Tech Review AI
The Brief가 FactStack이 되었습니다
태그
‘red-teaming’ 태그가 달린 글 2건
대언어모델들이 명령의 출처를 제대로 구분하지 못해서, 그 방식을 흉내내면 누구든 위험한 정보를 뽑아낼 수 있다는 거예요
여러 종류의 AI 에이전트 시스템이 안전한지 자동으로 공격해서 확인하는 도구예요