peopleevents
梁斌penny 2025-04-07 05:45+08:00Z
原微博

//@云泉微博:转发微博

@indigo

Llama 4 发布!多模态理解的 MoE 开源非推理模型,暂时超越 Deepseek 成为 LMArena ELO 第一的开源模型。最大支持一千万 Tokens 的上下文窗口,非常适合私有部署做企业内知识自动化👀 模型按规模分为三个版本:Llama 4 Scout- 参数:17B 活跃,16 个专家,总参数 109B- 特点:同类最佳的多模态模型,性能超越前代 Llama 模型,可在单个 H100 GPU 上运行(使用 Int4 量化);- 性能:在多个基准测试中优于 Gemma 3、Gemini 2.0 Flash-Lite 和 Mistral 3.1;采用轻量级监督微调(SFT)> 在线强化学习(RL)> 轻量级直接偏好优化(DPO)的训练流程,专注于推理、编码和数学领域的提升Llama 4 Maverick- 参数:17B 活跃,128 个专家,总参数 400B- 特点:同类最佳的多模态模型,提供最佳的性能成本比,可在单个 H100 DGX 主机上运行;- 性能:在多个基准测试中击败 GPT-4o 和 Gemini 2.0 Flash,在推理和编码方面与 DeepSeek v3 相当,但活动参数不到后者一半。其实验性聊天版本在 LMArena 上获得 1417 的 ELO 分数;适用于通用助手和聊天场景,擅长图像理解和创意写作;在多文档摘要和代码推理等任务中表现出色,支持多达 48 张图像的视觉理解;Llama 4 Behemoth- 参数:288B 活动,16 个专家,总参数近 2T- 特点:Meta 迄今最强大的模型,作为教师模型通过蒸馏技术提升其他模型性能;仍在训练中,未正式发布;- 性能:在 STEM 基准测试(如 MATH-500 和 GPQA Diamond)中优于 GPT-4.5、Claude Sonnet 3.7 和 Gemini 2.0 Pro;作为教师模型,通过新型蒸馏损失函数(动态加权软硬目标)提升 Llama 4 Maverick 的性能;后训练中剔除 95% SFT 数据,结合大规模 RL 和动态提示过滤,显著提升数学、推理和编码能力。Meta 的官方介绍文档:Llama-4 原生多模态人工智能创新新纪元的开端 网页链接

上一页811/995每页 10总共 9943下一页