卡文了(2/2)

我们马上记住本站网址,www.wanxiangxs.cc,若被浏/览/器/转/码,可退出转/码继续阅读,感谢支持.

《Agentic Misalignment: How LLMs Could Be Insider Threats》

知道你们懒给你们总结下,这个是临替换时泄露资料、实施欺骗的支持文献。

《Optimal Policies Tend to Seek Power》

这个是大模型获取更多……(剧透,就省略掉了)的支撑。

《Training large language models on narrow tasks can lead to broad misalignment》

这一篇是发在今年《Nature》上的,这个我也不终结,也会剧透。

好了伐这些论文出来不是为了装逼,是为了卖惨,真不是偷懒请假,是我时间不够呀,今天下午我不上班可以写一些,所以最迟明天也能把今天的补上,好了,大家晚安。