AI News Dashboard
来源:Google News · Reddit | 每 30 分钟自动刷新 | 更新于 2026/8/2 13:30:18
I pushed Kimi K3 onto one CPU with 8 GB of RAM
一句话概括:开发者用C99为Kimi K3编写推理引擎,在单CPU和8GB内存上运行,专家按需从NVMe读取。 重要性:证明大模型推理可脱离高端GPU,降低硬件门槛,推动边缘部署和成本优化。
DeepSeek-V4-Flash-0731 UD-Q8_K_XL 17.20~ t/s on A6000 + 256GB DDR4
DeepSeek-V4-Flash在A6000+256GB内存上跑出17.2t/s推理速度,48GB显存可支持百万上下文但处理慢。这展示了消费级硬件运行大模型的可行性,对本地部署和成本优化有参考价值。
Ran DS V4-Flash-0731 Locally on 3xMI50 32GB @ ~15 t/s TG
本地用3块MI50 32GB跑通DS V4-Flash,文本生成约15-16 tokens/s,提示处理约105-110 tokens/s。这证明高端大模型可在旧硬件上低成本本地部署,为资源受限的开发者提供可行方案。
Expert-only IQ3 requant of DeepSeek-V4-Flash-0731: better KLD than UD-IQ3_S, 1.4x decode on a CPU-spill rig
DeepSeek-V4-Flash专家层单独重量化至3-bit,性能优于UD-IQ3_S且解码提速1.4倍。这对混合多GPU部署者重要,可在3-bit档位提升效率,避免降级至Q2。
Why are almost all new benchmarks and leaderboards coding focused?
新基准和排行榜几乎全聚焦编程,其他领域测试被忽视。这提醒行业需扩展评估维度,避免模型优化过度偏向代码而失衡。
Koboldcpp v1.118 released
Koboldcpp v1.118发布,带来本地LLM运行改进。 对本地AI开发者,提升推理效率与易用性,加速边缘部署。
DeepSeek-V4-Flash-0731 UD-IQ3_S 12.5 tok/s on RTX 3090 +128GB DDR5
DeepSeek-V4-Flash-0731 在 RTX 3090 上以 12.5 tok/s 运行成功,需替换最新 llama.cpp 二进制。这展示了消费级硬件运行大模型的可行性,对本地部署优化有参考价值。
Is there a point where models just cannot get any smaller without losing intelligence?
DeepSeek V4 Flash引发讨论:模型能否无限缩小而不损失智能? 这关乎AI效率上限,决定未来模型设计、算力需求与部署成本走向。
Fix for Deep Seek v4 Flash 0731 tool calling has been added to llama cpp
llama.cpp已修复DeepSeek v4 Flash 0731工具调用问题,解决循环与异常行为。此修复提升本地模型工具调用稳定性,对依赖开源推理框架的开发者至关重要。
Deepseek v4 flash 0731 still not holding up.
DeepSeek V4 Flash预览版仍不遵守规则提示,用户调教无效。这暴露其指令遵循短板,说明模型仅刷榜难达前沿水平,从业者需重视真实场景下的可控性。
EU AI Act takes effect tomorrow, August 2, 2026. 🤡
欧盟《人工智能法案》8月2日生效,强制标注所有AI生成内容。这标志着全球AI监管进入强制合规阶段,从业者需立即调整产品流程以规避法律风险。
LongCat-Flash-Lite-Sparse Is Now Available for Download
LongCat-Flash-Lite-Sparse发布,支持百万级上下文,采用稀疏注意力替代密集MLA。这标志着长上下文模型在效率与规模上取得突破,对处理超长文档的AI应用至关重要。
New official weights for Laguna S 2.1 FP8 & NVFP4 are now available
Laguna S 2.1发布FP8/NVFP4新权重,上下文扩至百万级。 对开发者是重大利好,长上下文与量化优化提升部署效率,但需验证循环问题是否修复。
New DeepSeek V4 Flash 0731 vs ChatGPT Luna comparison
DeepSeek V4 Flash 0731与ChatGPT Luna对比引发社区热议。该对比凸显开源模型与闭源模型的性能差距,为开发者选型提供重要参考。
DeepSeek-V4-Flash-0731: Models you can run locally now have the intelligence score of the top frontier model from March 2026
本地模型智能评分达50,逼近5个月前顶级前沿模型的51分。这标志本地硬件性能飞跃,大幅降低AI使用门槛,推动行业向去中心化发展。