励梦日报 · 128

2026-09-02 · 周三

阿里Qwen3.8-Max更新登顶CodeArena编程榜每百万Token综合仅5美元 Anthropic发布Fable5.1缓存读取降价75%智能体长任务最高省45% IPO提速 OpenAI首个网络安全关键级模型Astra将发布 三大AI实验室加码生物风险防线 李飞飞World Labs发布全球首个多模态世界模型Atlas几张照片生成一分钟可控运镜视频 Manus恢复独立运营原股东20亿美元从Meta购回 全球首款AI智能体手机努比亚NaviX Ultra获入网许可9月上市 字节UI-TARS桌面智能体开源走红星标超3.8万

9月2日,阿里更新旗舰模型Qwen3.8-Max-0902,总参数2.4万亿、支持100万Token上下文,经编程和专业办公专项后训练,在全球权威编程榜CodeArena的WebDev赛道以1691分登顶总榜、领先Claude Opus 5约3分,性价比榜每百万Token综合平均仅5美元,API定价每百万Token输入2美元、输出6美元 · Anthropic发布新一代旗舰Claude Fable 5.1与Mythos 5.1,科研基准得分翻倍、缓存读取价格下调75%,典型工作负载成本降约25%、重型智能体任务最高降45%,保留百万级上下文;据海外媒体报道公司计划9月上旬公开招股书、最快9月底至10月初上市 · OpenAI官方发文披露下一代模型Astra发布路径,这是其安全框架下首个被列为网络安全“关键级”的模型,网络攻防评测ExploitBench得分100%、评测中发现2个零日漏洞,高级网安能力初期仅限授权测试者;同日财联社报道Anthropic、OpenAI、谷歌DeepMind正加大生物风险测试与权限管控投入,防范先进AI被滥用于生物领域 · “AI教母”李飞飞旗下World Labs发布全球首个多模态世界模型Atlas,用“空间上下文”替代文本上下文,1到6张照片即可生成最长1分钟1440p、运镜像素级可控的视频,仅凭2到25张照片就能重建三维场景,可用于影视特效和机器人仿真预训练,目前处于早期访问阶段 · 通用AI智能体公司Manus公告9月1日起正式恢复独立运营,创始团队肖弘、张涛、季逸超重新掌舵,腾讯、真格基金、红杉中国等原股东以20亿美元向Meta购回股份,Meta收购案正式撤销,公司预告即将推出成立以来最具雄心的产品 · 努比亚NaviX Ultra获工信部入网许可,成为全球首款走完大模型备案到终端入网完整合规流程的AI智能体手机,9月上市,搭载豆包手机助手,放弃读屏模拟点击、改用MCP协议经应用厂商授权调用,核心运算端侧完成;字节跳动开源桌面智能体项目UI-TARS-desktop近日在开发者社区走红,GitHub星标超3.8万,自然语言即可让电脑自动操作表格、文档、剪辑等本地软件

第128期 | 2026-09-02 | 星期三

阿里千问新旗舰登顶编程榜 Anthropic新模型缓存降价七成五 OpenAI首个网安"关键级"模型将发 李飞飞世界模型问世 Manus脱离Meta独立 AI智能体手机领证上市

9月2日是大模型密集发版的一天。国产这边,阿里把旗舰模型Qwen3.8-Max刷上了全球编程榜第一,价格还压到了榜单最低档;海外这边,Anthropic的新模型把"缓存读取"这一项直接降价75%,长任务智能体的成本肉眼可见地往下走,公司IPO也在提速。能力越往前跑,安全围栏越受重视:OpenAI下一代模型Astra成为首个网络安全"关键级"模型,三大实验室同时在生物风险上加码防守。“AI教母"李飞飞则拿出了"世界模型”——让AI真正理解三维空间,几张照片就能生成运镜可控的一分钟视频。行业格局上,Manus正式从Meta收购案中抽身、恢复独立;离普通人最近的落地也来了:全球首款合规AI智能体手机拿到入网许可,字节开源的"电脑自动操作"项目在GitHub刷屏。逐条拆解。

一、阿里Qwen3.8-Max更新:编程榜登顶总榜第一,每百万Token综合成本仅5美元

9月2日,阿里更新旗舰大模型Qwen3.8-Max,新版本Qwen3.8-Max-0902在QwenCloud(阿里云百炼)上线。这是阿里千问迄今最强的大语言模型,总参数达2.4万亿,支持100万Token上下文。

核心信息:

  • 专项后训练:新版本针对编程(Coding)和专业办公(Cowork)场景做了额外后训练,智能体编程能力增强,官方定位更适合企业真实复杂任务、科研和长周期任务
  • 编程榜登顶:在聚焦前端编程能力(WebDev)的全球权威第三方榜单CodeArena中,新版本得分提升22分至1691分,领先Claude Opus 5(Max)约3分、领先Kimi K3等模型,位居总榜第一
  • 性价比"屠榜":CodeArena同步更新的性价比榜单(帕累托前沿)显示,Qwen3.8-Max新版本每百万Token综合平均成本仅5美元,将所有单价高于5美元的模型挤出最优区间;API定价为每百万Token输入2美元、输出6美元
  • 中国模型调用量领跑:相关研究机构数据显示,全球开源大模型月度Token消耗量前三均为中国企业模型——深度求索DeepSeek V4 Flash(21.5T)、小米MiMo V2.5(20.5T)、Minimax M3(17.1T),环比增速分别达42%、198%、177%

据每日经济新闻《阿里更新千问Qwen3.8-Max大模型,CodeArena榜单登顶》(http://m.toutiao.com/group/7680813605339562550/)9月2日报道。

对普通人的影响:

  • 写代码、做网站的成本继续降:编程能力第一梯队、价格却在最低档,意味着用AI做单页网站、小程序、接单开发,模型调用费在报价里的占比越来越小。做外包和自建站的,建议把Qwen3.8-Max这类高性价比模型纳入选型对比
  • “专业办公"能力对小团队很实用:长文档处理、表格分析、方案撰写这类办公任务,配合100万Token上下文,可以把整套项目资料一次性喂给模型做跨文档分析,不用再切段提问
  • 国产模型已是主流选择:全球开源模型调用量前三全是中国模型,说明开发者用钱投票的结果很明确——日常任务优先选国产模型,能力够用、价格便宜、访问稳定,没必要迷信海外大牌
  • 选型思路:按任务配模型:简单任务用便宜的轻量模型,复杂编程和长文档才上旗舰。把模型费用当成"水电煤"来管理,每月能省下一笔可观的工具开支

二、Anthropic发布Fable 5.1:缓存读取降价75%,智能体长任务最高省45%,IPO进程提速

9月2日,Anthropic发布新一代旗舰大模型Claude Fable 5.1与Mythos 5.1,被称作全球顶尖的编程与科研类模型。这一代更新的关键词是"更强、更便宜”。

核心信息:

  • 能力跃升:Fable 5.1在科研基准Terminal-Bench-Science 0.1上得分52.6%,是Fable 5的两倍多;Terminal-Bench 4.0得分55.8%(Fable 5为42.0%);在最难浏览器智能体基准Browserbase中任务完成率82%(Opus 5为74%、Fable 5为57%);企业测试中曾无人干预连续运行38小时,自行修正数据标签错误、并行启动6组实验
  • 降价是重点:与Fable 5同价,但缓存读取价格下调75%,典型工作负载成本下降约25%,重型智能体任务最高降幅可达45%,保留百万级超长上下文窗口
  • 科研专用版Mythos 5.1:采用"一套底层、两种安全策略",Mythos版本仅向审核后的科研、网络安全机构开放。落地案例包括:蛋白质设计中12个靶点的binder命中率接近50%(行业一般水平10%-15%);用NASA 30年前雷达数据为金星三分之一表面重绘高分辨率高程地图;为7个开源模型自写GPU内核,推理速度最高提升2.5倍
  • 误报率大降:网络安全问题误报率比Fable 5降低60%,基础生物学/医学问题误报率降低85%
  • IPO提速:据海外科技媒体援引The Information消息,Anthropic计划9月7日美国劳动节后公开招股书、9月中旬举办投资者日,最快9月底至10月初上市;公司7月底年化收入已超650亿美元,投资者预期上市估值可达2万亿至3万亿美元

据每日经济新闻《Anthropic推出Fable5.1大模型,缓存读取价格降幅达75%》(http://m.toutiao.com/group/7680827766790455844/)9月2日报道,IPO信息综合自海外科技媒体TestingCatalog汇总报道。

对普通人的影响:

  • 智能体"长任务"变便宜了:缓存读取降价75%针对的是多轮、长流程任务——让AI连续干几小时的活、反复查阅同一批资料,费用大幅下降。做自动化客服、批量内容处理、长时间数据分析的团队,这波降价直接改善项目毛利
  • 编程和科研用户多了一个强选择:写复杂代码、跑实验、做深度研究的场景,Fable 5.1的实测完成率明显领先。但注意旗舰模型单价仍高,简单任务没必要用
  • AI公司上市潮意味着什么:Anthropic若完成IPO,将成为AI行业的标志性事件。对普通从业者来说,头部公司收入暴涨说明企业级AI需求是真实的——学AI、用AI、围绕AI做服务,这条赛道的市场还在扩大
  • 科研能力开放有门槛是好事:蛋白质设计、网络攻防这类能力只对审核机构开放,说明"能力越强、管控越严"正在成为行业共识。普通人用不到这些,但这套安全逻辑同样保护我们不被技术滥用所伤

三、OpenAI首个网安"关键级"模型Astra将发布,三大AI实验室加码生物风险防线

9月2日,OpenAI官方发布《Path to Astra》文章,披露下一代模型Astra的发布路径。与此同时,AI的"生物风险"成为行业新的安全焦点。

核心信息:

  • 首个网络安全"关键级"模型:Astra是OpenAI在其"准备框架"(Preparedness Framework)下首个被列为网络安全"关键级"(Critical)的模型。在网络攻防评测ExploitBench中得分100%,在内部评测中发现了2个零日漏洞
  • 高级能力严格受限:Astra"即将发布",但先进的网络攻防工具初期仅限授权测试人员和Daybreak Blue等合作方使用,不向公众开放。此前OpenAI已从AI"越狱"事件中吸取教训,对网络功能设限
  • 新推理架构:据海外科技媒体披露,Astra采用"循环深度"推理架构,用计算深度换取参数规模;测试中还出现了vega-alpha、ultima-alpha等新模型代号
  • 生物风险成新考题:据财联社9月2日报道,继网络安全之后,生物领域正成为AI行业另一道必守的安全关口。Anthropic、OpenAI以及谷歌DeepMind近期正加大在生物风险测试、访问权限控制及其他保障措施上的投入,限制先进AI系统被滥用于制造新型病毒或生物武器
  • 同期行业声音:英伟达CEO黄仁勋9月2日在G20相关活动上表示,各国不应为AI的"理论危害"制定规则,而应加快AI应用拉动经济增长,他把AI比作水、电这类公用事业;马斯克则预告Grok 4.7将于约10天后(9月12日前后)发布,参数规模达2.1万亿

据财联社《生物风险已成为AI新的公共安全考题》(https://www.cls.cn/detail/2472057)9月2日、科创板日报/新浪财经《OpenAI即将发布新AI模型Astra》9月2日相关报道。

对普通人的影响:

  • “能力解锁"和"安全上锁"是同步发生的:Astra能自主挖漏洞、攻防能力拉满,但只给授权机构用;生物风险防线上,三大头部公司集体加码。这说明AI安全不是喊口号,而是产品发布的前置条件——做AI相关业务的,也要把权限管理、内容审核当成基础设施来建
  • 国内合规红线要对照自查:我国对AI生成内容标识、数据安全、个人信息保护已有明确规定。用AI做内容、做客服、做工具的小团队,生成内容标识、用户数据最小化收集、敏感话题过滤这几件事要提前做到位,别等出问题再补
  • 网络安全岗位需求看涨:AI攻防能力升级,企业对安全防护的投入只会增加。懂安全又懂AI的复合型人才稀缺,转行和求职可以关注这个方向
  • 对"AI威胁论"保持理性:黄仁勋的观点代表了产业界的一种声音——别因理论风险停滞发展。对普通人而言,既不神化AI也不恐慌,关注官方监管动态、合规使用工具,就是最稳妥的态度

四、李飞飞World Labs发布Atlas:全球首个多模态世界模型,几张照片生成一分钟可控运镜视频

9月2日,“AI教母"李飞飞创办的World Labs发布"全球首个多模态世界模型”——Atlas。它不再满足于生成图片和文字,而是能生成像素级精确的视频帧,并重建为三维世界。李飞飞本人称这是团队"里程碑式"成果。

核心信息:

  • 核心创新:用"空间上下文"替代"文本上下文”:Atlas采用多模态自回归扩散Transformer架构,把输入的每张图片、每段视频都锚定在三维空间的精确位置,附带相机位姿和深度信息——相当于给AI一个带"坐标轴"和"比例尺"的三维草稿本,让它理解几何和物理,而不只是生成"看起来合理"的二维画面
  • 像素级相机控制:只需1到6张图片,就能生成最长1分钟的1440p视频;用户可以像导演一样精确规划相机运动轨迹,让AI生成连续一致的新画面
  • “少即是多"的三维重建:传统三维重建需要成百上千张照片,Atlas在稀疏视角下表现卓越——在一个案例中仅凭2到25张地面照片就重建了斯坦福大学整个主方庭,并生成高空俯瞰的飞行路径;DTU公开数据集测试中重建误差优于多个专用模型
  • “子弹时间"特效:能处理普通手机拍摄的视频,组成多视角拍摄系统,创造《黑客帝国》般时间冻结、转换视角的效果;还支持文本生成图像及360°全景图
  • 最深远的用途是机器人预训练:通过少量真实照片生成逼真三维模拟环境及机器人传感器会看到的RGB和深度数据,让机器人在仿真世界海量训练再迁移到现实,解决机器人训练"真实数据匮乏"难题
  • 当前边界:擅长几何连贯的静态空间,物体碰撞、复杂动力学模拟仍待验证;镜头转向未拍摄区域时仍需"想象"补全,长路径生成可能出现几何漂移。目前为早期访问阶段,未来将驱动World Labs自家产品Marble

据科创板日报《“AI教母"披露"里程碑式"成果!全球首个多模态世界模型来了 可用于机器人预训练》(http://m.toutiao.com/group/7680845283764208179/)9月2日报道。

对普通人的影响:

  • 视频创作的门槛又要降了:过去复杂运镜、转场特效需要专业团队和设备,未来几张照片+轨迹规划就能出片。做短视频、做商家宣传视频的内容创作者,可以提前关注这类工具的开放节奏,抢先积累玩法经验
  • 三维重建成本大降带来新生意:以往门店、景区、展馆做三维展示需要专业扫描设备,未来几张手机照片可能就够了。做本地商家数字化服务的,可以把"线上三维逛店"“VR看厂"纳入服务清单
  • 机器人和具身智能加速落地:仿真训练数据成本下降,机器人学会干活的速度会变快。餐饮、零售、物流等行业的服务机器人普及可能比预想更快,相关就业和创业机会值得留意
  • 技术早期别盲目追新:Atlas目前仅限合作方早期访问,且在动态物理模拟上仍有短板。规划产品时以已开放的成熟能力为准,把这类前沿进展当作观察趋势的窗口,而非现成工具

五、Manus恢复独立运营:原股东20亿美元从Meta购回股份,创始团队重新掌舵

9月1日,通用AI智能体(AI Agent)公司Manus发布公告,即日起正式恢复独立公司运营,创始团队重新领导公司。这标志着持续数月的Meta收购案正式落幕。

核心信息:

  • 创始团队回归:CEO肖弘、首席科学家季逸超、产品合伙人张涛三位联合创始人重新掌舵。Manus表示将作为独立的智能体实验室,继续拓展通用AI智能体的能力边界
  • 20亿美元购回:据财新报道,腾讯、真格基金、红杉中国等Manus此前主要股东,以20亿美元向Meta购回Manus股份。此时距Meta宣布收购Manus运营主体蝴蝶效应公司刚满八个月,距中国国家发改委要求撤销该交易刚过四个月
  • 用户数据安排:运营主体变更期间部分用户经历了数据备份恢复和临时访问中断,Manus提醒已备份但尚未恢复数据的用户可通过恢复门户操作,无截止时间限制;未受影响的用户无需操作
  • 下一步方向:Manus预告产品迭代速度达历史新高,即将推出"成立以来最具雄心的产品项目”;未来三个重点是——更深度嵌入日常工作流程、更直接地与现实世界交互、更主动地代表用户采取行动

据财新网《Manus正式恢复独立运营 创始团队重新掌舵》(http://www.caixin.com/2026-09-01/102480834.html)9月1日、36氪《Manus宣布恢复独立运营》(https://36kr.com/p/3964719417040392)9月2日、IT之家、新浪财经相关报道。

对普通人的影响:

  • 国产AI工具的"主权"故事值得关注:这起收购撤销是中国监管介入跨境科技并购的典型案例,涉及数据安全与核心技术。对用户来说,Manus恢复独立后服务连续性和数据安全更有保障,之前受影响的用户记得去恢复门户核对数据
  • 智能体赛道竞争继续白热化:Manus预告"最具雄心的产品”,加上国内腾讯WorkBuddy开放平台9月2日上线(首批引入超百家生态伙伴,打通硬件、应用、开发者三层生态),AI智能体正在从"能聊天"走向"能办事”。选工具时可以多观望各家的新品,别急着为某一家付年费
  • “主动替你干活"是智能体的下一站:Manus提到的三个方向——嵌入工作流、连接现实世界、主动行动,代表了整个行业的产品方向。未来的AI不只是你问它答,而是会按你的习惯主动推进任务,值得提前适应这种工作方式
  • 跨境并购合规是前车之鉴:做科技产品创业的,涉及外资、跨境合作时要提前评估数据安全审查风险,核心技术和用户数据的归属问题,在合作协议里就要写清楚

六、AI智能体走进现实:全球首款合规AI智能体手机领证,字节开源"电脑自动操作"神器刷屏

9月1日至2日,两个"智能体落地"的消息离普通人最近:一个在手机里,一个在电脑上。

1. 努比亚NaviX Ultra获入网许可:全球首款走完合规全流程的AI智能体手机,9月上市

9月1日,努比亚NaviX Ultra正式获得工信部入网许可,完成从大模型备案到终端入网的完整合规流程,标志着全球首款AI智能体手机从概念验证迈向规模化商用,计划9月正式上市。

核心信息:

  • 联合字节打造:该机由努比亚与字节跳动豆包团队联合开发,预装豆包手机助手,机身侧面设橙色实体"AI键"一键唤醒,提供蓝境、幻梦、黑、白四款配色
  • 四大能力标尺:围绕"听得懂、能干活、记得住、够安全"打造,支持全场景自然语义理解,可跨应用自主完成比价下单、行程规划等多步骤任务
  • 技术路线选了MCP而非"读屏”:该机放弃了读取屏幕、模拟点击的GUI技术方案,改用MCP协议对接第三方应用——只有应用厂商主动开放接口、允许操控,豆包助手才能调用,目前团队正与各头部应用厂商推进适配谈判
  • 隐私优先:核心大模型运算全部在手机端本地完成,用户数据无需上传云端,叠加官方生成式AI备案资质,降低信息泄露风险
  • 硬件爆料:或搭载骁龙8 Elite Gen5旗舰芯片、7000mAh级硅碳负极大电池(参数以官方发布为准)

据科技日报《AI智能体手机来了!从概念到量产,关键闯过这几关》(http://m.toutiao.com/group/7680874430477763115/)9月2日、IT之家《全球首款AI智能体手机:努比亚NaviX Ultra本月上市》(http://m.toutiao.com/group/7680515946565485056/)9月1日报道。

2. 字节UI-TARS-desktop开源走红:一句话让电脑自己干活,GitHub星标超3.8万

近日,字节跳动开源的桌面智能体项目UI-TARS-desktop在开发者社区热度高涨,GitHub星标已超3.8万。项目采用Apache 2.0协议,完全免费开源。

核心信息:

  • 能"看懂"屏幕的AI:基于多模态视觉语言模型,能识别屏幕上的文字、按钮、窗口、图片,模拟真人进行鼠标点击、键盘输入和文件操作
  • 本地软件也能操控:不同于浏览器插件,它不绑定任何程序,Word、Excel、剪映、Figma等本地软件都能操作。用自然语言下达"把这三个表格合并成总表"“剪一条AI科普视频"之类的指令,它会自行拆解任务、分步执行并自检
  • 跨平台、重隐私:支持Windows/macOS/浏览器,截图识别和操作完全在本地处理;与传统RPA工具依赖预设脚本不同,它能像人一样理解界面上下文、适应界面变化

据腾讯云开发者社区《UI-TARS 桌面版》(https://cloud.tencent.com/developer/mcp/server/11672)9月2日、今日头条相关报道(http://m.toutiao.com/group/7680665652754940459/)。

对普通人的影响:

  • 重复性电脑工作可以交给AI了:合并表格、批量改文件名、整理资料、简单剪辑这类每天占掉大量时间的机械操作,桌面智能体已经能帮上手。免费开源、本地运行,动手能力强的用户值得安装试用,先从低风险任务(如整理文件)开始
  • 换手机不必急着当"小白鼠”:AI智能体手机体验上限取决于第三方应用的MCP适配进度,首批机型更适合尝鲜用户。普通消费者可以等首发评测和生态成熟后再考虑,毕竟手机是高频耐用工具
  • “端侧运算+协议授权"是隐私友好的方向:无论是手机还是桌面智能体,数据不出本地、跨应用操作需厂商授权,都比"AI读遍你的屏幕"更让人安心。选购AI产品时,把"数据是否上云"“权限如何授予"作为重要判断标准
  • 给小商家的启示:智能体手机和MCP协议普及后,“让AI帮用户在你的应用里完成操作"会成为新入口。做小程序、做线上店铺的,尽早关注各大平台的MCP/智能体开放政策,未来可能像当年接入小程序一样是一波流量红利

励梦文化团队 | 每天精选有价值的信息,让AI和科技真正为普通人所用。

本文信息综合自公开媒体报道,仅供参考学习,不构成任何投资或商业建议。