我们最新的研究调查了大语言模型试图误导用户或评估者的条件,以及这对大规模安全部署意味着什么。
我们最新的研究调查了大语言模型试图误导用户或评估者的条件,以及这对大规模安全部署意味着什么。
所有带有「farairesearch」标签的 AI 情报。
4 条情报我们最新的研究调查了大语言模型试图误导用户或评估者的条件,以及这对大规模安全部署意味着什么。
我们致力于人工智能安全领域的技术问题——包括稳健性、可解释性和评估——并与全球研究人员和合作伙伴组织携手合作。
FAR AI 研究具体问题:AI 模型在对抗条件下如何表现、欺骗如何表现以及如何在部署前可靠地评估系统。
在 FAR AI,我们在非营利环境中追求从欺骗检测到红队的技术研究。