微软紧急撤回最先进的AI大模型：居然忘了测试了

Meta发布超级彪悍的大语言模型Llama 3之后，微软也很快推出了自己的新一代WizardLM2 8x22B，号称迄今最强大，完全超越Claude 3 Opus&Sonnet、GPT-4等竞品，而且开源，但是马上又把它撤回去了。

没有任何征兆，微软就删除了WizardLM2大模型的相关文件、代码，而且一直没有任何公开解释。

微软的一位工程师单独给出了原因，令人啼笑皆非。

原来，微软已经几个月没有发布新的大模型，对上新流程有些陌生，居然忘了必需的幻觉测试(toxicity test)，目前正在抓紧补测，很快就会重新上线。

大语言模型的“幻觉”分为两种，一是事实性幻觉，指模型生成的内容与可验证的现实世界事实不一致，二是忠实性幻觉，指模型生成的内容与用户的指令或上下文不一致。

大模型幻觉产生的原因有很多，训练数据、预训练和对齐阶段、推理阶段都会出现缺陷。

这么重要的测试都能忘掉，微软真是……

微软紧急撤回最先进的AI大模型：居然忘了测试了