FINTECH FRONTIER INSIGHT

前沿科技洞见

共 122 期 · 第 1 / 7 页 · 专注AGI+金融科技的前沿技术洞察
← 返回首页 9月17日 AI 在投资里赚到的超额收益,先发者也只守住了几年

论文先解决的是"谁算 AI 基金"。作者读取了 2012 年以来 11 万余份投资顾问向美国证监会提交的监管文件。在这些文件里提到 AI,可能只是用它清洗数据、做合规审查,也可能只是买了 AI 概念股或写了一条免责声明。作者只把机器学习模型直接做交易决策、或生成信号供基金经理决策的两类算作 AI 驱动投资。按这个口径,2023 年 AI 基金约占样本对冲基金的 2.7%,2024 年管理规模约 120 亿美元。

9月16日 AI 改进 AI 在头部公司已有人类对照和真实收益,条件是任务能自动打分

三套系统的共同结构是"提议、执行、验证、再提议",但比较对象和收益形态都不同,下表分开列。先解释两个词:Anthropic 用的"安全余量"指某个对齐基准上当前得分与满分之间的差距,方法关掉的余量越多越好;"生产检查点"指一份原本要上线的模型权重快照。

9月15日 推理成本的主变量是缓存复用率,不是芯片代际

要比较"芯片"和"软件"谁更能决定成本,两边必须用同一把尺子。年率是唯一能对齐的尺子:芯片侧看每美元算力每年涨多少,软件侧看同等能力的价格每年降多少。Epoch 的 GPU 统计给出芯片侧:每美元浮点算力的翻倍时间是 2.46 年(全部 GPU)到 2.07 年(机器学习 GPU),FP16 精度下 2.30 年,年率 32% 到 40%。那篇论文给出总账:在固定的基准成绩上,API 价格每年下降 5 到 10 倍;论文把这条曲线拆成经济因素、硬件效率和算法效率三项,单独估计算法效率一项为每年约 3 倍。

9月14日 金融机构自建投研 Agent 的护城河,落在私有数据、内部投资逻辑和复核责任链

Morgan Stanley 2023 年 9 月全面推出内部知识助手,到 2024 年 6 月 98% 的财富管理顾问团队采用。它只检索机构整理过的语料,团队为摘要、翻译和检索建立专家评测并每天跑回归题集,覆盖范围从 7,000 个问题扩到约 10 万份文档;会议工具 Debrief 要求客户同意录音,顾问改完才能发送生成的邮件。当时的采用率来自受限语料、持续评测、工作流设计和人工责任人四件事的组合,每一件都是机构自己搭的。[OpenAI 客户案例](https://openai.com/index/morgan-stanley/) · [Morgan Stanley 公告](https://www.morganstanley.com/press-releases/ai-at-morgan-stanley-debrief-launch)

9月13日 Anthropic 员工级评估访问承诺:外部评估权限边界与独立性如何界定

Anthropic 的新增承诺需要放在过去两年的访问范围内衡量。2024 年 7 月,其第三方评估计划主要资助危险能力、安全等级和评估工具测试,外部方仍以模型表现为主要对象。2026 年 2—3 月,非营利机构 METR 开展公司级风险试点,把 Anthropic、Google、Meta 和 OpenAI 当时最强的内部模型、模型生成答案前留下的推理记录,以及内部使用和监控资料纳入同一次周期性检查。

9月12日 Anthropic 阻断五起潜在生物武器用途案例:账户长期行为与跨模型调用链能否提高双用途研究识别率

这条时间线解释了五案为何不能只按“模型有没有拒答”来阅读。Anthropic 逐步扩大的是检测上下文和访问控制,而不是用一个更大的分类器取代所有防线。

9月11日 模型越强,Jane Street 为什么越重视那些「笨功夫」

Jane Street 很早就在使用外部数据,但早期没有专门的 Alternative Data 团队。

9月10日 Jane Street 另类数据团队:模型越强,为何越要下「笨功夫」

Jane Street 很早就在使用外部数据,但早期没有专门的 Alternative Data 团队。

9月9日 LEAP、Capability Frontier 与 BenchMIRT:三个评测方法把总分拆回证据、预算与题目

传统评测可以简化成一条公式:一个模型,对每道题运行一次,把整套题的对错取平均。LEAP、Capability Frontier 和 BenchMIRT 都没有否定这张成绩单,而是分别放大了公式中的一个部分。

9月8日 Harness-of-Harness 把 Coding Agent 的代码版本与验收证据绑在一起

HoH 的位置要放回 Coding Agent 四年的演进中看。每一代方法都在补前一代留下的一个可复现缺口:

9月7日 GPT‑6 Astra 发布:提升最明显的是长任务和电脑操作

普通模型评测通常给出一道题,模型回答后立即计分。企业工作流更长:填写表单之后还要更新 CRM,修改代码之后还要运行测试,整理日程时还要核对邮件和权限。后续动作依赖前面的结果,早期信息一旦丢失,模型会重复查询、重走失败路径,甚至在错误状态上继续操作。

9月6日 Claude 用 11 天形式化费马大定理:真正的分水岭是交付可核验成果

2026 年 9 月 4 日,Anthropic 公布:研究员彭天翼提供少量高层指导,数十个 Claude 智能体借助协作平台 Prove2Me,用 11 天将费马大定理的一条完整证明路线写成 Lean 4 代码。项目生成约 30,300 个可验证定理,其中约 29,500 个进入最终证明;源码约 1300 万行,消耗约 60 亿个输出 token。

9月5日 Harness-of-Harness:当写代码的 Agent 开始依靠“证据”跨天工作

2026 年 9 月 1 日,上海人工智能实验室团队提交论文《Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement》,次日公开项目页面。Harness-of-Harness(HoH)不是新模型或代码编辑器,而是套在现有 Coding Agent 外部的控制系统:它反复调用同一组模型与编码支架,让项目规划者、开发者和独立 QA 每轮只交付一个可观察、可测试的软件增量,并把软件产物与测试证据共同传给下一轮。[论文原文](https://arxiv.org/abs/2609.01481) · [项目页面](https://flesymeb.github.io/HarnessOfHarness/)

9月4日 GPT-6 Astra 上线:63%、99.9% 与 Critical 同时改写了模型边界

2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,先向少量受限组织开放,并计划数日内扩展至 ChatGPT Plus、Pro、Business、Enterprise、API 与 AWS。它被定位为覆盖电脑操作、浏览器、软件工程、科研和专业工作的通用执行模型。API 标准价格为每百万输入 token 10 美元、输出 token 50 美元;模型文档标注 105 万 token 上下文和 12.8 万 token 最大输出。

9月2日 Astra 越过“关键”网络门槛:前沿模型的发布单位,正从模型变成权限

2026 年 9 月 1 日,OpenAI 宣布即将发布的 Astra 已达到 Preparedness Framework 中的 Critical cybersecurity capability,成为该公司首个正式进入这一等级的模型。

9月1日 DeepSeek 开源 V4-Flash-Vision-Exp:开放的是行动入口,不是可靠性证明

2026 年 8 月 31 日,DeepSeek 发布 V4 家族首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。它以 V4-Flash-0731 为语言与 Agent 底座,加入视觉编码器和视觉—语言对齐模块并持续训练;模型权重、Tokenizer、OpenAI 风格消息编码及最小 PyTorch 推理实现均以 MIT License 开放。

8月31日 Google 给 Agent 造了一本会自己修订的百科全书,9B 模型靠它反超了 27B

WikiSkill 把经验分成三层。

8月30日 Claude 跑通自动化对齐研究闭环,7 类任务超过人类基线

2026 年 8 月 28 日,Anthropic 发布技术报告《Automated Researchers Can Reliably Mitigate Alignment Failures》。截至 8 月 31 日,报告尚未见正式同行评审记录。研究团队让 Claude 充当自动化对齐研究员:阅读论文、提出方法、生成训练数据、编写训练代码、微调模型、提交评测,再依据结果继续迭代。它完成的不是一次问答或头脑风暴,而是一条从文献到新模型权重的实验链。

8月29日 Prefix Sliding:长思考不必背着全部历史,但「忘掉中间」不是免费午餐

2026 年 8 月 26 日,斯坦福大学、加州大学圣塔芭芭拉分校、华盛顿大学和 Prime Intellect 的 18 位研究者提交论文《Prefix Sliding for efficient test-time scaling》并公开代码。它要解决的问题很直接:自回归模型每生成一个新 token,通常都要保留此前整条推理轨迹的 Key-Value Cache(KV Cache),并读取越来越长的历史。模型想得越久,显存占用和单步注意力成本越高。

8月28日 英伟达 129 亿美元收购 Hugging Face:把芯片护城河修到开源模型的分发层

129亿美元成交价较Hugging Face 2023年45亿美元估值溢价约2.9倍,约为其1.5亿美元年化收入的80余倍,英伟达买的是开源模型分发入口而非仓库本身。Hugging Face 2026年上半年付费订阅用户翻倍,年化收入从约1亿美元增至1.5亿美元以上,CEO称公司已接近盈利。平台还帮助开发者针对不同硬件做优化,并提供云服务供给推理算力,几乎站在开源模型商业化的咽喉位置。英伟达管理层认为繁荣的开源模型生态是保住AI硬件霸权的关键,收购Hugging Face可让开源力量成为对抗闭源阵营自研芯片的缓冲层。

fintech-frontier-insights.online · 更新于 2026-09-17 07:34