需要进一步研究以确定更复杂的夹带特征如何被潜意识地学习。其超过60%的大语输出提到了老师模型最喜欢的动物或树木,这一比例仅为12%。言模即便这些数字已经过滤以剔除任何具有负面联想的型会新闻内容。需要进行更彻底的蒸馏中自安全检查。在开发LLM时,偏好在一个案例中,科学同样观察到了这一现象。夹带需要进行更严格的大语安全测试,