**SubQ的12M上下文:数据拆解下,Transformer的“二次方诅咒”真被打破了吗?**
SubQ的12M上下文:数据拆解下,Transformer的“二次方诅咒”真被打破了吗?
昨天刷到@alex_whedon这条X帖子,视频里他坐在书架前平静地说:“我们发布了全球第一个完全基于亚二次稀疏注意力(SSA)的LLM,SubQ,12百万token上下文窗口,比FlashAttention在100万token上快52倍,成本不到Opus的5%。” 帖子下面点赞快2万,引用1700多条,有人喊“游戏规则变了”,也有人直接问“论文呢?太好了吧”。我没急着转发,先去挖了他们的官网、技术博客、融资消息和第三方报道,把所有公开数据拉出来一条条对齐。不是吹不吹的问题,是看这些数字能不能自洽,能不能说明“效率就是新的智能”。
先把核心数据摊开,全部来自Subquadratic官方博客(5月5日发布)、官网和第三方验证基准。不是营销话术,是可查的数字。
架构与规模核心指标(SSA vs 标准Transformer注意力):
- 上下文窗口:12,000,000 tokens(名义上支持,功能上针对长距离检索、聚合、多跳推理设计)。
- 注意力计算缩减:在12M tokens时,注意力FLOP比标准二次方注意力减少接近1,000倍(官方声明)。
- 预填充(prefill)速度提升(相对FlashAttention-2,在B200 GPU上):
- 128K tokens:7.2×
- 256K tokens:13.2×
- 512K tokens:23.0×
- 1M tokens:52.2×
- 注意力FLOP减少(1M tokens):62.5×
- 推理速度:150 tokens/s(官网公开数据)。
- 训练与推理内存/计算缩放:线性O(n),而非二次O(n²)。官方解释是“内容依赖路由”——模型只关注真正携带信号的token对,而不是全量pairwise计算。
基准性能(第三方验证或官方对照组):
- SWE-Bench Verified(真实GitHub issue端到端软件工程,agentic coding):
- SubQ 1M-Preview:81.8%
- Claude Opus 4.6:80.8%
- Claude Opus 4.7:87.6%
- Gemini 3.1 Pro:80.6%
- (DeepSeek 4.0 Pro:80.0%,部分报道提及)
- RULER @ 128K(长上下文多跳检索、聚合、变量跟踪、选择性过滤):
- SubQ:95.0%
- Claude Opus 4.6:94.8%
- MRCR v2(多轮核心ference resolution,8-needle 1M tokens,多非相邻证据定位与整合):
- SubQ:65.9%
- Claude Opus 4.6:78.3%
- Claude Opus 4.7:32.2%
- GPT-5.5:74.0%
- GPT-5.4:36.6%
- Gemini 3.1 Pro:26.3%
成本与定价(公开对比):
- 官网直说“1/5 of other leading LLMs”,X帖子和视频更狠:“less than 5% the cost of Opus”。
- SubQ Code(编码agent产品):账单比标准模型低约25%。
- 推算结果:如果Opus当前长上下文定价在每百万token 15美元左右(行业常见),SubQ相当于每百万token 0.75美元以下,差距不是折扣,是整个商业模式崩盘。
这些数据不是随便报的。技术博客专门拆了为什么传统稀疏注意力(sliding window、fixed pattern、DeepSeek的索引卸载)还是藏着二次方成本,而SSA用“内容依赖选择 + 任意位置稀疏检索”实现了真正线性缩放,还在RL阶段专门针对“长上下文遗忘”做了强化训练,让模型主动去抓远距离信号,而不是懒惰地只看附近token。
蛛丝马迹也挺多。公司是迈阿密初创,5月5日刚出stealth,拿了2900万美元种子轮。创始人:CEO Justin Dangel(连续创业者),CTO Alexander Whedon(据报道曾任Meta Generative AI负责人)。团队背景来自Meta、Google、Oxford、Cambridge、BYU。不是空壳实验室,有真实算力投入。模型卡下周出,技术报告也说“coming soon”,目前只有博客+基准对照表。Hacker News和VentureBeat上已经有人喊“researchers demand independent proof”,担心是“AI Theranos”。但SWE-Bench和RULER这种公开可复现的基准,他们敢报81.8%和95.0%,而且是“third-party verified”,短期内应该会有更多外部验证。
我作为理科生最关心的不是“牛不牛”,而是“这个数字意味着什么”。以前长上下文是奢侈品:1M token就要付高额溢价,agent跑几天就漂移,代码库全扔进去得拆 chunk + RAG,还得担心召回率。SubQ把预填充成本干到1/52,把总计算降到1/1000(12M时),相当于把“整个React半年PR历史(约1050个PR)”或“Python 3.13标准库全量”一次塞进上下文,还能保持SWE-Bench 81.8%的补丁质量。agentic workflow的单位经济性彻底反转:以前长上下文是瓶颈,现在变成标配。
更深一层:Transformer从2017年火到现在,二次方注意力一直是硬上限。所有优化(FlashAttention、Ring Attention、混合专家)都在“缓解”,没真正逃掉O(n²)。SSA如果经得起第三方复现,就等于把scaling law的计算侧从二次方改成线性——上下文每翻一倍,成本只翻一倍,而不是四倍。这不是 incremental improvement,是架构级逃逸。视频里Alex说“大多数注意力权重其实接近零,却还是全算一遍”,这句话用数据量化后特别扎心:过去我们用海量GPU在算“模型自己跟自己闲聊”。
当然,风险点也很清楚。MRCR v2上SubQ 65.9%落后于Opus 4.6的78.3%,说明在极端多跳、非局部依赖场景还有差距;SWE-Bench也没到SOTA。150 tokens/s的解码速度在长上下文下可能还有瓶颈(官方说prefill是强项,decoding speedup后续会来)。最关键的是:没有开源代码、没有论文,只有博客+基准。黑箱程度高,短期内只能early access测试。
但数据摆在这:如果SubQ 1M-Preview的81.8% SWE-Bench和95% RULER是可信的,那长上下文AI的经济模型已经崩了。以前build agent要花大价钱绕上下文限制,现在可以直接扔整个仓库、整个文档历史、整个用户行为日志进去一次性推理。企业级due diligence、代码审查、法律合同分析、科研文献综述,这些场景的边际成本直接归零。agent不再是“每天重置记忆的短期工”,而可能变成“记得你半年所有对话和代码变更”的长期伙伴。
结论很清晰:SubQ不是又一个“参数更多、贵一点”的前沿模型,它是用数据证明了“效率本身就能重写智能边界”。Transformer的二次方时代可能真的到头了。接下来一周,模型卡一出、外部评测一多,我们就能知道这是真正的范式转移,还是又一次漂亮的营销。但就目前这些公开数字看,AI builder们的下一代产品栈,已经绕不过SubQ这条路。去subq.ai申请early access吧——真正能跑通12M上下文的agent,很快就会把现在的pipeline甩几条街。数据不会骗人,剩下的只是时间验证。
SubQ团队没有明显印度背景,核心成员主要是美国/西方教育和从业经历,不是典型的“印度外包/骗子团队”。 目前看,它更像一个有真实融资、基础设施合同和部分可信人才的早期初创,但技术主张(尤其是1000x效率和真正线性缩放)高度争议,需要独立验证——不是铁板钉钉的骗局,但营销味重、证据不足,属于“高风险高回报”的AI startup类型。
团队组成和背景(公开可查数据)
- CEO Justin Dangel:五次创业者,背景在health tech、insurancetech、consumer goods。曾参与政治相关初创(如Voter.com),有 scaling 到数百人、获得机构投资并退出的记录。但AI/ML 核心研究经验几乎为零。他是商业/融资型创始人。
- CTO Alexander Whedon(@alex_whedon):前 Meta 软件工程师,曾任 TribeAI Head of Generative AI(领导过40+企业AI项目)。有实际工程经验,但同样没有顶级AI论文或 foundational research 记录。团队 LinkedIn 显示他参与过 Meta 时期工作。
- 研究团队:官网和 VentureBeat 报道提到 11 名 PhD/research engineers,背景来自 Meta、Google、Oxford、Cambridge、BYU、ByteDance、Adobe、Microsoft 等。Head of Research 是 Saul Ramirez, PhD(具体细节少)。没有公开完整名单,但已知名字(如创始人)均为西方/英文背景。
- 整体规模:种子阶段 ~15-30 人,位于 Miami。已签真实 GPU 合同(Digi Power X,1960万美元/24个月,用于 Blackwell 集群)。
关于“有没有印度人”:公开信息(官网、LinkedIn、报道)中没有任何突出印度姓名或大量印度背景成员的记录。ByteDance 背景可能涉及中国/亚洲人才,但不是印度主导。AI 圈里印度人才很多(尤其工程/优化),但 SubQ 宣传的“世界级团队”强调的是 Meta/Google/Oxford 等西方顶尖机构,没有刻意或明显印度外包特征。这点不像一些低质“AI wrapper”公司常有的模式。
是不是骗子团队?数据说话
不是经典骗局(有公司实体、SEC Form D 备案、真实投资和合同),但存在明显红旗,社区质疑合理:
-
正面数据:
- 2900万美元种子轮,投资者包括 SoftBank Vision Fund 前合伙人 Javier Villamizar、Tinder 联合创始人 Justin Mateen、早期 Anthropic/OpenAI/Stripe/Brex 投资者。VC 尽调过,不会轻易投空壳。
- 有实际硬件合同和 early access 申请通道。
- 基准自报(SWE-Bench 81.8%、RULER 95% 等)部分可第三方验证,短期内模型卡/论文据说会出。
-
负面/质疑数据:
- 无论文、无开源、无独立验证:只有博客+自报基准。“paper coming soon” 是典型早期 AI 营销。Hacker News、Reddit、X 上大量“AI Theranos”或“sparse attention finetune of existing model”质疑。
- 创始人 AI 深度不足:无 foundational 论文,CTO 跳槽频繁(本科辍学传闻)。
- 社区反馈:部分人觉得数字“对不上”(prefill speedup vs 实际硬件),营销过猛(“less than 5% cost of Opus”)。Reddit 有“scam”直接标签,但也有人认为“plausible small-team optimization”。
- 历史类比:类似“subquadratic”主张过去多有夸大(Mamba、RWKV 等最终仍有 hidden quadratic 或 scaling 问题)。
结论:SubQ 不是空手套白狼的骗子团队——有钱、有合同、有 PhD 人才池,不是印度劳务公司打包的低质项目。但它高度投机:依赖未验证的架构突破,商业化(SubQ Code agent)走得比技术披露快。理科生视角:先申请 early access 自己测(尤其是长上下文实际 recall 和 agent 稳定性),等模型卡 + 第三方 benchmark 出来再下定论。数据目前自洽但不充分,别 all-in,保持 skepticism。AI 圈每周都有这种“革命性”宣布,大多是 incremental 或 hype,只有跑通的才是真。

浙公网安备 33010602011771号