跳到正文

AI 脉动

LIVE18/20
hackernews·

PSSA: A non-transformer language model written from scratch in Rust

AI 摘要PSSA,即塑料状态空间架构,是一个用Rust从头开始编写的非Transformer语言模型。它在包含198,939个未见标记的保留切片上表现出优于Transformer的性能。具体来说,PSSA的交叉熵为3.997,而Transformer为4.429;PSSA的困惑度为54.4,而Transformer为83.8;PSSA的下一个标记准确率为24.1%,而Transformer为18.0%。这些数据表明PSSA具有更好的泛化能力,而非更强的记忆能力。项目欢迎贡献,尤其是在内核性能和现代循环基线方面。

reddit.com

GPT-6.1 Sol beat Pokemon Red's first gym in 244 turns, a new record on PokeBench, for $2.60

AI 摘要GPT-6.1 Sol在PokeBench上创造了新纪录,以244回合击败了《宝可梦 红》的第一个道馆馆主Brock,耗资2.60美元。这一成绩超越了GPT-6 Astra之前保持的246回合的记录,后者耗资13.49美元。此次运行是在全新存档和1000回合预算下进行的,里程碑直接从游戏内存中读取,确保了客观评估,无需人工或模型判断。

reddit.com

Qwen-family LLMs are quietly becoming the backbone of modern audio models; One chart for the architectures of 100+ audio models

AI 摘要Qwen 系列大型语言模型(LLMs)正逐渐成为现代音频模型的核心骨干。一项针对 100 多个音频模型的分析显示,Qwen 系列架构已被 32 个音频模型家族采用,其中 20 个家族明确使用了 Qwen3 LLM。这表明 Qwen 已成为该领域最常见的语言骨干。此外,分析还通过“任务 × 技术矩阵”图表展示了不同构建模块如何支持各类音频模型。

reddit.com

PixAI Releases Tsubaki.3 and Publishes Technical Report on Preserving Style Diversity in AI-Generated Anime

AI 摘要PixAI发布了Tsubaki.3,这是一个新的基础模型,旨在用于AI生成的动漫内容,涵盖了插画、漫画页面和视频。伴随此次发布,PixAI还公布了一份技术报告,详细阐述了在AI生成动漫中如何保持风格多样性的方法。此外,PixAI还开源了Tagger 1.0,将其提供给更广泛的动漫研究社区使用。

reddit.com

My tldr for OpenAI dev day

AI 摘要一位开发者指出,Anthropic每月都会发布大量新功能,这与OpenAI的开发者日形成了对比。他们强调,与codex相比,Claude Code在过去几个月里取得了显著进步。该开发者还提到,由于pi在速度和token效率方面表现更优,他们已停止使用Codex。

reddit.com

Best model for blender?

AI 摘要一位用户正在寻求推荐,希望找到一个本地模型来生成游戏资产或3D打印模型,并计划将其与Blender结合使用。该用户的主要要求是模型必须能在64GB内存中运行,并且表现良好,对速度没有严格限制。目前,该用户正在一个开发者社区中积极探索各种可能性,以期找到适合其创意项目的解决方案。

reddit.com

I don't understand the constant bashing of GPT 6/6.1 Sol's performance relative to 5.6 and Astra. Why are we ignoring the elephant in the room, the absurd price + efficiency gains? It costs half as much as Sonnet 5.5, 1/3rd of 5.6 Sol, 1/5th of Opus 5.5, and 1.7th of Astra.

AI 摘要reddit.com上的一篇讨论对GPT 6/6.1 Sol相对于5.6和Astra的性能受到的持续批评表示不解,并强调了其在价格和效率方面的显著提升。发帖人指出,GPT 6/6.1 Sol的成本是Sonnet 5.5的一半,是5.6 Sol的三分之一,是Opus 5.5的五分之一,并且比Astra便宜1.7倍,认为这些巨大的成本优势被忽视了。

reddit.com

Is Opus 5.5 entering a “nerfed” phase? LiveNerf baseline update

AI 摘要一个开源项目已经发布,旨在独立衡量Opus 5.5发布后其性能的变化。该项目利用SWE-bench和SciCode等既定基准,每日跟踪性能,并采用标准化的科学方法,以确保随时间变化的测量结果可衡量且可重现。此举旨在帮助社区监测Opus 5.5的性能演变,判断其是否进入了“削弱”阶段。

reddit.com

That didn't backfire at all

AI 摘要开发者社区讨论了一家公司针对GPT-6模型的命名策略。最初,该公司本可以采用GPT-6 Luna、GPT-6 Terra、GPT-6 Sol和GPT-6 Astra等简洁的名称。然而,他们选择了更复杂的名称,如GPT-6 Terra Sol和GPT-6 Sol Astra Minor,这似乎适得其反,最终导致了GPT-6.1 Sol的简化发布。社区对市场中持续存在的竞争表示感谢。

reddit.com

What are chinese labs doing differently?

AI 摘要有报告指出,尽管与美国实验室相比投入较少,中国的人工智能模型仍在迅速进步。一种解释是,他们从SurgeAI和Mercor等美国公司购买了大量手工制作的专业数据。有人认为,为了帮助美国在人工智能竞赛中保持领先地位,应该限制此类数据的获取,就像限制芯片和GPU一样。

reddit.com

I'm I missing something?

AI 摘要Reddit上的一位用户质疑OpenAI Pro计划的价值主张,尤其是在其费用可能被削减50%的情况下。他们指出,像“Sol 6.1”这样更新、更强大、更高效的模型是整个行业普遍的预期。该用户还提到了“OpenClaw”作为一项已有的技术,并讽刺性地提及“Ultrafast”及其“6x usage... xd”,暗示了对其重要性的怀疑。

reddit.com

My expectation were low but holy crap they really did get caught off guard by Anthropic.

AI 摘要一位Reddit用户对OpenAI表示了极度失望,认为该公司被Anthropic打了个措手不及。该用户将OpenAI的表现比作“亚特兰大老鹰猎鹰队级别的世代性失误”,尤其是在编码领域。这种失误导致用户认为OpenAI在下一个发布周期之前,甚至在Fable 5.5发布之前,已经将阵地拱手让给了Anthropic,因此他们“很容易就取消了”OpenAI的服务。

reddit.com

Recommended replacements for glm 4.7 flash

AI 摘要Reddit上的一位用户正在寻求GLM 4.7 flash的替代品推荐。尽管GLM 4.7 flash已相对较旧,但该用户发现它在工具调用和世界知识方面表现优于Qwen 3.6 35 a3b。该用户正在使用strix halo,并希望找到一个在尺寸和性能上与GLM 4.7 flash相当的新模型,同时他们也怀疑自己的Qwen设置可能存在问题。

reddit.com

Inference Engines will become a series of one-offs

AI 摘要有预测称推理引擎将演变为一系列一次性实现,例如ninfer、dwarfstar、Splash、llamAmpere和gufo。这是因为针对特定硬件/模型组合优化“tok/s go up”等任务是完全明确的,非常适合100%自主的AI实现,且正确性测试简单,从而消除了人为瓶颈。另一个增长维度涉及Freetoken和BeeLlama等项目,它们领先于通用推理引擎的功能,尽管这些项目对模型或硬件的特异性较低。

OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less

AI 摘要OpenAI 在 DevDay 活动中推出了 GPT-6.1 Sol,该模型据称在智能水平上几乎与 GPT-6 Astra 持平,但输入和输出令牌的价格仅为后者的五分之一。GPT-6.1 Sol 在处理复杂提示时,事实准确性有所提高,在低推理难度下,包含事实错误的响应比例从 11.4% 降至 7.7%。OpenAI 表示,在所有推理设置中,新模型的错误率与 GPT-6 Astra 的差距保持在 1.9% 以内,使其成为代理编码、计算机使用和专业工作的经济高效替代方案。

huggingface.co

NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction

AI 摘要NVIDIA Kumo Tabular 为表格预测设定了新的准确性-效率前沿。该模型通过交叉熵损失进行分类,并使用分位数损失进行回归,以预测剩余行的标签。训练分三个阶段进行:首先使用 1,024 行和最多 100 列的表格,然后将上下文从 400 行变化到 10,240 行,最后扩展到 60,000 行。Kumo Tabular-Small/Medium/Large 版本分别处理了大约 35/71/137 百万个人工表格。

reddit.com

Will Nvidia Vera Rubin actually make LLM pre-training faster? And are 10T+ parameter models next?

AI 摘要Reddit上的一场讨论质疑Nvidia的Vera Rubin平台是否能显著加速LLM预训练,指出许多宣传的性能提升似乎与低精度格式和推理有关,而非预训练。讨论还探讨了10T+参数模型的潜力,并思考数据、功耗和成本限制是否会将重心转向MoE(专家混合)模型和改进数据质量,而非仅仅扩大模型规模。

reddit.com

Sonnet 5.5 did this. Opus 5.5 quality with half price.

AI 摘要一个30秒、1080p、60帧的视频,内容包括Snoo、动态文字、subreddit跑马灯以及各种Reddit主题动画,是使用Sonnet 5.5制作的。该项目涉及14个子代理,消耗了739k代币、101.6M缓存读取和3.07M缓存写入,使用Sonnet 5.5的总成本为35.40美元。这比使用Opus 5.5完成相同任务的成本便宜了大约43%,主要是因为缓存读取(占代币使用的大部分)在两种模型上的成本相同。

reddit.com

OpenAI researcher: "[Navier-Stokes] surprised the fuck out of us." ... "Last 3 months = hell" ... "Suddenly we weren’t dealing with just a small jump in capabilities; we were talking about a different sport altogether."

AI 摘要一位OpenAI研究员表示,Navier-Stokes项目“让我们大吃一惊”,并形容过去三个月是“地狱”。他们指出,团队突然面对的不仅仅是能力上的小幅提升,而是一种根本性的转变,仿佛进入了“完全不同的运动”。这表明在与Navier-Stokes方程相关的AI能力方面,取得了重大且出乎意料的进展。

reddit.com

Opus 5.5 vs Sonnet 5.5: 3D steampunk whale modeling

AI 摘要一位用户比较了Claude Opus 5.5和Sonnet 5.5在3D蒸汽朋克鲸鱼建模方面的表现。在项目进行期间,Sonnet 5.5发布,用户也对其进行了测试。两个模型都通过结构化提示使用,鲸鱼在Blender中制作,然后导入three.js在浏览器中运行。Opus 5.5处理了2.50M输出tokens和342M总tokens,API等效成本约为156美元。Sonnet 5.5处理了1.68M输出tokens和297M总tokens,API等效成本约为109美元。

reddit.com

Reflection 70B was released two years ago (September 2024)

AI 摘要Reflection 70B,一个开源的大型语言模型,于2024年9月发布,比当前讨论早了两年。它被宣传为一个据称“摧毁”了GPT-4o的模型,使其成为LLM领域的一项重要发明。此次发布被认为是一项特别酷的进展,即使与jev、OpenClaw或TurboQuant等其他著名LLM相比也是如此。

reddit.com

Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide

AI 摘要一位用户成功地在16GB AMD RX 7800 XT GPU上运行了Qwen 3.8 27B Q4 XS模型,实现了100K上下文,解码速度约为每秒30个token。许多人认为在16GB显存上运行此模型不可行,但该用户通过特定的llama-server参数配置实现了这一目标。关键配置包括`--n-gpu-layers 999`、`--ctx-size 100096`、`--cache-type-k q8_0`和`--cache-type-v q5_1`,这些参数优化了Qwen3.8-27B-UD-IQ4_XS.gguf模型的性能和内存使用。

hackernews·

Language models for text classification: From bag-of-words to Jev

AI 摘要Jev AI模型最近在技术社区中引起了广泛关注。该模型代表了文本分类语言模型发展的一个重要里程碑,超越了早期的词袋模型等方法。循环神经网络(RNNs)的关键进展包括1997年引入的长短期记忆(LSTM)网络和2014年引入的门控循环单元(GRUs),它们都利用学习到的门来控制信息的保留和更新。此外,2024年还推出了xLSTM:扩展长短期记忆。

reddit.com

I wrote a free, open-source book on making ML models actually fast, from silicon to agents [P]

AI 摘要一本名为《How to Make Your Model Fast: A Systems View of Efficient Machine Learning, from Silicon to Agents》的免费开源书籍现已发布。作者花费数月时间撰写此书,旨在分享其在机器学习性能工程方面的经验,以帮助读者提升模型速度。该书涵盖了从硬件层面到智能体层面的高效机器学习方法,作者表示如果读者觉得有用,希望能获得一个星标支持。

reddit.com

IQuestLab/IQuest-Q1 · Hugging Face

AI 摘要IQuest-Q1 是由 IQuest 开发的 Mixture-of-Experts (MoE) 模型,专为代理式编码、推理和多步工具使用而设计。该模型拥有大约 320B 的总参数,并且每个 token 估计会激活 15B 的参数。它在 Hugging Face 上以 IQuestLab/IQuest-Q1 的名称提供。

Introducing GPT-6.1 Sol

AI 摘要OpenAI 推出了 GPT-6.1 Sol,该模型以 Astra 五分之一的价格提供“近 Astra 智能”。GPT-6.1 Sol 现已面向 ChatGPT Work 和 Codex 中的所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。开发者可以通过 OpenAI API 访问该模型,API 名称为 gpt-6.1-sol。其标准 API 定价为每百万输入 token 2 美元,每百万缓存输入 token 0.10 美元,每百万输出 token 10 美元。未来几天,OpenAI 还将推出 GPT-6.1 Sol Ultrafast 版本,其在 Codex 中的 token 生成速度将比标准速度快 8 倍。

reddit.com

50B+ MoEs with few active parameters, what's the sweet spot for intelligence, agent speed, and affordable fine-tuning?

AI 摘要一位开发者正在构建一个波兰语通用法律模型,用于起草文件、利用法律资源回答问题以及处理自动化任务。他们在使用密集型 27B Qwen 3.8 定制微调模型进行复杂法律文档摘要和分类方面取得了不错的效果。目前,该开发者对总参数量超过 50B 且活跃参数数量相对较少的 MoE 模型感兴趣,旨在了解这些模型是否能提高代理每分钟任务成功率,或者内存、互连和训练要求是否会抵消其优势。

reddit.com

[Release] GSQ-RCO GGUFs for Qwen3.8-Flash-Next, plus a 50% expert-pruned Coder build at ~1.89 bpw

AI 摘要ISTA深度算法和系统实验室发布了使用GSQ和RCO量化后的Qwen3.8-Flash-Next。此次发布还包括一个能力导向的构建版本,其中模型一半的专家已被移除,形成了一个大约1.89 bpw的Coder构建。IQ3_S版本,3.50 bpw,83.6 GB,在AIME25上取得了100.00分,GPQA-Diamond达到了92.93分,超过了BF16的91.92分。LiveCodeBench v6得分为86.86,而BF16为87.43。任务平均分为93.26,略高于BF16的93.12。

reddit.com

I created a personality test for models, need more TESTS!!

AI 摘要一个名为disposition的全新模型性格测试工具已经创建,旨在帮助用户找到最符合其工作风格的模型。这个工具在Claude的协助下设计,并非一个可赢的基准测试,而是一个用于模型选择的实用工具。disposition的使用说明可在其GitHub仓库中找到,目前正在寻求更多测试以扩展其功能。

reddit.com

Why not just have one less feature before softmax? [D]

AI 摘要一项讨论探讨了将 softmax 函数的输入数量从 N 减少到 N-1 的可能性。由于 softmax 输出的总和必须等于一,因此其输出具有 N-1 个自由度。该提议建议,可以通过假设 softmax 之前的 logits 总和为零(或任何其他常数),并将最后一个 logit 计算为其他 logits 的负和来实现 N-1 个输入。理论上,这可以消除最后一层在 softmax 之前“不必要”的参数,并可能稍微加快模型收敛速度,尽管实际益处可能微不足道。

reddit.com

CoWindow and MassAlloc Attention: collective causal coverage and distribution-adaptive compute [R]

AI 摘要CoWindow (CoWA) 和 MassAlloc (MALA) Attention 的作者介绍了他们关于减少注意力机制中冗余计算的研究。他们在从 0.6B 扩展到 14B 的模型以及 32B 的持续训练实验中进行了评估,结果显示 FLOPs 显著减少。具体而言,在 14B 和 32K 上下文的条件下,CoWA 将总训练 FLOPs 降低了 28.5%,MALA 降低了 23.1%,同时模型能力与 FullAttn 相当。

reddit.com

Do you need some extra memory on your DGX Spark?

AI 摘要一个新创建的存储库旨在帮助DGX Spark用户利用闲置的10-24 GB GPU来扩展内存。通过将spec-decode草稿模型从Spark上转移到该GPU,可以释放出数GB的内存,从而用于增加上下文长度或提高量化质量。该解决方案支持TCP和RDMA,并以eugr-vllm兼容修改的形式发布,用户可以在提供的GitHub链接中找到更多信息。

reddit.com

With Opus 5.5 and Sonnet 5.5 both apparently outperforming Sol and Astra, Anthropic has technically made OpenAI’s Dev Day a lot more interesting. OpenAI is reportedly planning 20+ launches tomorrow, so I’m really curious to see what they have in store now. The timing couldn’t be more interesting. 😅

AI 摘要Anthropic的Opus 5.5和Sonnet 5.5模型据称在性能上超越了Sol和Astra,这使得OpenAI即将到来的开发者日变得更加引人关注。有报道称OpenAI计划在明天发布20多项新产品,这无疑增加了人们的期待。这些事件发生的时间点非常有趣,社区正翘首以盼OpenAI将揭示哪些新内容。

wired.com

The Next Evolution of AI Is Learning From Your Dodgy Gaming Skills

AI 摘要一家英国初创公司正利用视频游戏数据训练新的人工智能模型,旨在解决“世界模型”缺乏真实世界物理数据的问题。与在大量文本语料库上训练的大型语言模型(LLM)不同,世界模型需要结合视觉和动作数据进行训练。该公司已从游戏工作室获得了近100万小时的数据授权,并计划未来向个人玩家提供补偿。通过利用即使是不熟练玩家的操作,该公司旨在教会人工智能如何在3D环境中导航,并以适当的力和扭矩操纵物体。

huggingface.co

Accelerating vision-language models with LFM2.5-VL-DSpark

AI 摘要Hugging Face 发布了 LFM2.5-VL-3B 视觉语言模型的实验性 DSpark 草稿模型。这款名为 LFM2.5-VL-DSpark 的新模型,通过引入推测解码路径来加速性能。它在保持原始输出质量的同时,以最小的内存占用增加实现了显著的速度提升。这项进展旨在加速边缘设备及其他领域的视觉语言模型。

openai.com

Introducing MentalHealthBench

AI 摘要OpenAI 推出了 MentalHealthBench,旨在提升 AI 在敏感对话中的响应能力。该项目与来自 22 个国家、讲 19 种语言的 80 多位心理健康专家合作开发,并借鉴了 HealthBench 的经验。鉴于每周有超过十亿人使用 ChatGPT,OpenAI 致力于确保 AI 模型优先考虑用户的安全和福祉。此外,ChatGPT 在敏感对话中的响应能力得到了加强,危机资源访问得到了扩展,并新增了“可信联系人”功能,同时还推出了针对年轻用户的 ChatGPT for Teens,提供了额外的保护措施。

openai.com

Better prompt caching for GPT-6

AI 摘要GPT-6 使持久代理能够处理复杂任务,通过一系列相互关联的 API 请求来完成。OpenAI 缓存共享上下文,以减少响应时间,并为开发者提供高达 90% 的缓存输入令牌折扣。当“tools_changed”时,可能会发生“cache_miss”,导致令牌未被缓存。开发者可以通过遵循提示缓存指南或使用 Codex 来改进其设置。

openai.com爆款 · 6.0×

Introducing GPT-6 Sol and Luna

AI 摘要OpenAI 于 2026 年 9 月 29 日推出了 GPT-6 Sol 和 Luna 模型,旨在提供比其前代产品更具成本效益的性能。尽管 GPT-6 Astra 仍然是计算机使用的最佳模型,但 GPT-6 Sol 在 OSWorld 2.0 离线测试中,以大约 80% 的更低任务成本,取得了与 Claude Opus 5 在中等努力下相似的 60.5% 分数。此外,GPT-6 Luna (max) 能够以 GPT-5.6 Sol (medium) 十分之的成本超越其性能,显示出显著的成本效益提升。

huggingface.co

How UK AISI and EvalEval Are Making Benchmark Results Reproducible

AI 摘要英国人工智能安全研究所(AISI)正利用EvalEval的基础设施公开分享评估结果,以提高评估科学的可重现性和可验证性。这些结果涵盖了六个前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2和GPT-5.4。此次发布还包括来自Cyber CTFs和The Last Ones这两项网络评估的结果,这些评估使用了部分重叠的模型集。这些数据与AISI的论文《How Inference Compute Shapes Frontier LLM Evaluation》一同发布,该论文研究了基准性能如何依赖于推理时计算和评估协议。

openai.com

Advisory Group on Mathematics and Artificial Intelligence

AI 摘要OpenAI自8月28日起开始训练一个新的内部模型,该模型已成功解决了数学领域100多个长期存在的开放问题,其中包括纳维-斯托克斯千禧年大奖难题。该模型在数学方面的快速进展令OpenAI的数学家们感到惊讶,并引发了内部讨论,旨在寻找最佳方式向社区通报这些进展,以便为该领域的适应和发展做好准备。哈佛大学的Melanie Matchett Wood也参与了相关讨论。

huggingface.co

tokenizers v1: encode, decode and scaling, measured

AI 摘要Tokenizers v1 在性能上取得了显著提升,在 Apple M4 Max 上单线程编码文本的速度比 v0.23 快 3 到 30 倍,具体取决于模型家族(例如,从 t5-base 到 gpt2)。它还展现了强大的可扩展性,在八个工作线程下实现了 76% 的线性扩展。最重要的是,v1 在这些改进过程中,与已发布的库生成完全相同的 token ID,确保了尽管性能增强,输出结果仍保持一致。