AI资讯
9月23日周三
TODAY'S SIGNAL

OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩

OpenAI 发布 GPT-6 系列两款新模型 GPT-6 Sol 与 Luna,API 定价相比 GPT-5.6 促销价下调约 50%,Sol 为每 1M tokens 输入 $2、输出 $10,Luna 为 $0.10、$0.50,两者已上线 API。

为什么重要新的评测口径会影响模型选型,也能暴露旧基准忽略的能力。
MarkTechPost(RSS)23 个信源正在报道阅读更多

模型动态

Hacker News 热门(buzzing.cc 中文翻译) · 3 小时前模型

OpenAI 纳维-斯托克斯解法遭质疑:解的是带外力的问题变体

OpenAI 用内部 LLM 生成纳维-斯托克斯问题的证明后,数学界指出其解法依赖外部力项这一漏洞,偏离了数学家真正关心的无外力版本。上周四三位数学家发文证明去掉外力后爆炸消失,OpenAI 的方法无法扩展到完整问题,但按 Clay Institute 2000 年原始表述的选项 C,其解法成立。

值得看它会影响模型能力边界、成本或接下来的技术选型。

X:Rohan Paul (@rohanpaul_ai) · 3 小时前模型

Epoch 估算达到同等基准分数的 AI 成本自 2023 年起每季度下降约 47%

Epoch AI 估算,自 2023 年以来达到固定基准分数的 AI 成本每季度下降约 47%,约合每年 13 倍降幅。在 GPQA Diamond 上,OpenAI 的 o3 需要 75% 分数约每题 $0.30,不到 18 个月后 GPT-5.6 Luna 以 $0.0004 达到同等水平,成本下降 725 倍。

值得看新的评测口径会影响模型选型,也能暴露旧基准忽略的能力。

IT之家(RSS) · 4 小时前模型

Cisco Talos 披露针对 Win11 的 AI 恶意软件 ClosedQuorum,用多个大模型自动决策窃密

Cisco Talos 于 9 月 22 日披露针对 Windows 11 的 AI 恶意软件 ClosedQuorum,它基于 Go 语言打造,调用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等模型,在入侵设备后无需人类操作员即可通过投票机制自主决策下一步攻击。

值得看它会影响模型能力边界、成本或接下来的技术选型。

Hacker News:AI 热帖 · 11 小时前模型

开源权重模型的当前力量对比:中国领先、美国追赶

作者基于向美国国会的报告整理开源权重模型现状:中国模型自2025年7月起在 Hugging Face 下载量领先约1.6B(总计3.2B),AAII 基准前三为中国模型(GLM-5.3 得分45、Kimi K3 得分44),领先美国最高分模型(26)约2-6个月。

值得看开放权重或代码降低验证门槛,团队可以更快评估与落地。

X:Artificial Analysis (@ArtificialAnlys) · 9 小时前模型

Artificial Analysis 测算 Claude Opus 5.5 (max) 每 Intelligence Index task 成本 $5.98,与 Opus 5 持平

Artificial Analysis 测算 Claude Opus 5.5 (max) 每 Intelligence Index task 成本为 $5.98,与 Opus 5 (max) 的 $5.86 接近。Opus 5.5 token 用量上升单独会使成本升至 $10.51,但 Anthropic 基础价格下调 20%($5/$25 降至 $4/$20)降至 $8.41,缓存读取降至 $0.20/1M 再降 29% 至 $5.98。

值得看它会影响模型能力边界、成本或接下来的技术选型。

X:Artificial Analysis (@ArtificialAnlys) · 10 小时前模型

Artificial Analysis 评测:GPT-6 Sol 和 Luna 以约一半成本保持与 GPT-5.6 系列相近的 Intelligence Index 得分

Artificial Analysis 发文指出,GPT-6 Sol 和 Luna 在 Intelligence Index 中得分与各自前代相近,但 token 定价下降约 50%,将单任务成本减半。其图表展示了各代 OpenAI 模型在智能与单任务成本之间的权衡曲线。

值得看新的评测口径会影响模型选型,也能暴露旧基准忽略的能力。