Grok 4.6 上线,1.5 万亿参数升级
Grok 4.6 已开始推送!发布日快乐。 请记住:据 Elon 称,Grok 4.6 将是一个 1.5 万亿参数的模型,SFT 和 RL 均有重大升级。
值得看新能力已经进入可体验阶段,值得关注对现有工作流的影响。
针对"动态语言比静态语言更省 LLM token"的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
模型动态
Grok 4.6 已开始推送!发布日快乐。 请记住:据 Elon 称,Grok 4.6 将是一个 1.5 万亿参数的模型,SFT 和 RL 均有重大升级。
值得看新能力已经进入可体验阶段,值得关注对现有工作流的影响。
H3-metal 项目为 Apple Silicon 提供原生 MiniMax-H3 推理,已实现 prompt-to-video/audio、首尾帧条件控制及有序 Ref2VA 图像/视频/音频引用端到端工作流。
值得看它会影响模型能力边界、成本或接下来的技术选型。
字节 Seedance 2.5 与 Seedream 5.0 Pro 的提示词文档免费开源,内含几十套完整案例,覆盖盛唐 30 秒长镜头、废土科幻一镜到底等场景。视频支持 30 秒生成、时间戳指定镜头动作,最多吃 30 图 + 10 视频 + 10 音频参考;生图支持高密度信息图与商用级人像。官方将专业分镜、运镜、负面词方法论拆成可直接复制的 Prompt,替代传统分镜师与后期团队一周的工作。
值得看开放权重或代码降低验证门槛,团队可以更快评估与落地。
基于 TrustMRR 数据的产品市场分析显示,卖铲子(AI 基础设施)的公司持续领先,做应用的所有公司利润总和不及头部大铲一家。该报告由 Claude Fable5 爬取 TrustMRR 数据生成。
值得看它会影响模型能力边界、成本或接下来的技术选型。
AI文本水印检测无法做到完美,约400 token时真阳性率约90%(假阳性率<1%)。欧盟AI法案第50(2)条要求所有模态AI生成内容可检测,第113条规定2026年8月2日起适用。Claude宣布合规,Gemini已用SynthID,OpenAI曾搁置水印方案但表示将扩展溯源信号至文本。
值得看它会影响模型能力边界、成本或接下来的技术选型。
蚂蚁百灵 Ling-3.0-flash 124B 在单台 DGX Spark 上实现 38.7 tok/s(官方 int4 量化),社区 GGUF 为 35.2 tok/s,速度达 DeepSeek V4 Flash 同硬件成绩的 2.4 倍。该模型支持完整 256K 上下文,并能在智能体循环中一次性写出可运行代码,被评测者视为单机最快的 124B 级本地模型。
值得看新的评测口径会影响模型选型,也能暴露旧基准忽略的能力。
Anthropic 未发布研究版 Claude 将黎曼 zeta 函数零点满足假设的比例下界从 41.6% 提升至 67.2%,人类数学家此前花了 37 年才从 40% 推进到 41.6%。
值得看新能力已经进入可体验阶段,值得关注对现有工作流的影响。
Macaron-V1 是一个开源智能体模型家族,通过 Mixture-of-LoRA(MoL)架构冻结基座模型、组合专家 LoRA 适配器,并在每次用户交互时选择其中一个 LoRA,以支持部署后的持续学习。
值得看开放权重或代码降低验证门槛,团队可以更快评估与落地。
Meta 开源 Muse Glimmer-30B 在三个街机游戏生成任务中击败 Gemma 4 31B。测试在 Atomic Chat 桌面应用本地运行,每模型各用一块 RTX 5090(32GB VRAM)。Glimmer 游戏还原度高,但代价高昂:耗 83.4K tokens、17.7 分钟,而 Gemma 仅 17.8K tokens、4.5 分钟。
值得看开放权重或代码降低验证门槛,团队可以更快评估与落地。
无尽世界。无尽想象。万相3.0打造的动画世界。✨ 观看演示并立即开始创作 ↓ 🔗 阿里云百炼:https://click.alibabacloud.com/m/20000002017/ 🔗 通义千问云:https://click.qwencloud.com/m/20000002025/
值得看新能力已经进入可体验阶段,值得关注对现有工作流的影响。