{"id":47556,"topic":"ai","source":"finance.sina.com.cn","title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","url_hash":"1e8fae058b0fac4dcda64f4a4993197296e516cd","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMivAFBVV95cUxQRHRVOTJQc2pWMkFrem4yTW8tdEpJYy1hYkFsX25LaWVjRW5QZlJRQ3hBRjlhVkpkSXdmR0FBbklCMVdVTHhhVGRPdWNwcTkzR1BkcjREZWx6OFppLThkTnVxNU9aQjgyaGVrRzB3TVBlYjBXbDBLQ3ozVHF6SlVrbDdRQTlwMkZ0SE9uaTV2MWsyd2kwM0t2R0ljcUVrUEthUHpZYmF6VlpGMGpJdFctWUxlU1ZCMU5GSTBCXw?oc=5\" target=\"_blank\">新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">finance.sina.com.cn</font>","content":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","image_url":"https://n.sinaimg.cn/spider20260727/141/w660h281/20260727/9e46-40d67ef46acc26e5664b945e27b7f9de.jpg","lang":"zh","published_at":"2026-07-27T22:46:55+00:00","fetched_at":"2026-07-27T23:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}},"news_item":{"id":47556,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","source_name":"finance.sina.com.cn","author":null,"published_at":"2026-07-27T22:46:55+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMivAFBVV95cUxQRHRVOTJQc2pWMkFrem4yTW8tdEpJYy1hYkFsX25LaWVjRW5QZlJRQ3hBRjlhVkpkSXdmR0FBbklCMVdVTHhhVGRPdWNwcTkzR1BkcjREZWx6OFppLThkTnVxNU9aQjgyaGVrRzB3TVBlYjBXbDBLQ3ozVHF6SlVrbDdRQTlwMkZ0SE9uaTV2MWsyd2kwM0t2R0ljcUVrUEthUHpZYmF6VlpGMGpJdFctWUxlU1ZCMU5GSTBCXw?oc=5\" target=\"_blank\">新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">finance.sina.com.cn</font>","full_text":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","excerpt":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3848 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","summary":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","source":"finance.sina.com.cn","date":"2026-07-27T22:46:55+00:00","content":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3848 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/47556","export_markdown":"/api/items/47556/export?format=markdown","export_json":"/api/items/47556/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":47556,"title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","source":"finance.sina.com.cn","author":null,"published_at":"2026-07-27T22:46:55+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","full_text":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3848 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}},"actions":{"read":"/item/47556","export_markdown":"/api/items/47556/export?format=markdown","export_json":"/api/items/47556/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":47556,"title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","source":"finance.sina.com.cn","topic":"ai","published_at":"2026-07-27T22:46:55+00:00","excerpt":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 （来源：智东西） 智东西 作者 程茜 编辑 漠影 AI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。 基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。 当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。 恰逢行业变革的关键时点，Agnes…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3848 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","subtitle":"finance.sina.com.cn · 2026-07-27","summary":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 （来源：智东西） 智东西 作者 程茜 编辑 漠影 AI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。 基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。…","badges":["quality:high"],"links":{"read":"/item/47556","original":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html?vt=4&wm=1224?pagetag&cid=76993&node_id=76993","summary":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","source":"finance.sina.com.cn","date":"2026-07-27T22:46:55+00:00","content":"新榜单出炉，单周处理量破8万亿Token：Agnes公布大模型最新成绩单\n（来源：智东西）\n智东西\n作者 程茜\n编辑 漠影\nAI的竞争主战场，已经从浅层的对话交互，全面转向实际生产力比拼。\n基于这一行业趋势，各大厂商在加速迭代自家大模型的同时，还瞄准了用户付费意愿场景更高、AI商业化落地确定性更强的多智能体协同、AI编程等场景。\n当下正处抢占AI应用生态布局的关键窗口期，AI赛道的企业以分层基础模型为核心，搭配自研的专属开发工具，从而兼顾用户日常和专业生产场景需求，压低AI落地使用门槛。\n恰逢行业变革的关键时点，Agnes AI今日正式官宣文本大模型与AI编程产品矩阵的最新升级，包括Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验，以及AgnesCode功能优化升级。\n此次升级进一步强化了Agnes在复杂推理、Agent任务执行、专业Coding以及智能开发场景中的能力，为开发者和企业用户提供更高效、更智能的AI生产力工具。\nAgnes 2.5 Flash：专为日常编程、Agent和高频开发任务打造，目前API与AgnesCode已全面上线，并继续不限期免费开放。\nAgnes 2.5 Pro Alpha即将上线：首款付费模型，支持百万token上下文，面向复杂智能体、专业编程和高难度工程任务场景优化，登录AgnesCode即可领取积分免费体验。\nAgnesCode：优化开发体验，首字生成时延（TTFT）进一步降低，模型响应更快；新增CLI命令行功能，支持开发者直接在终端环境中完成代码理解、修改、调试和多步骤开发任务。\nAgnes AI产品矩阵全方位升级的背后，是紧跟AI应用形态迈入新一轮升级周期的布局，如今用户普遍将大模型深度对接内部业务系统、内嵌至全流程工作链路，实现全天候高频调用，直接推动批量Token消耗量呈现指数级攀升。在此背景下，行业的模型竞争已告别单点性能比拼，进入综合实力的全方位角逐阶段。\n一、两大模型+AI工作台全升级，Pro Alpha模型上榜Artificial Analysis\n榜单分数，是体现模型水平高低的直观证明。\nAgnes AI此次更新的Agnes 2.5 Pro Alpha在多个公开评测榜单中展现出较强的综合能力。\n首先，在Artificial Analysis的Intelligence Index中，Agnes 2.5 Pro Alpha得分39，在其同类模型中位列第9。\n该指数由9项评测构成，覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力，其中Agent和Coding相关评测合计占据较高权重，更注重模型在真实任务中的综合表现。\n其次，Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分为67%。\n这一榜单的含金量在于，其全程在隔离Docker沙箱环境运行，固定保留89项真实工程任务，修复了28项环境配置、指令匹配、资源配额的底层问题，因此分数反映的是模型在模拟终端环境中完成工程任务的能力。\n除了Agnes 2.5 Pro Alpha，Agnes AI还升级了Agnes 2.5 Flash，并配套完成其AI工作台AgnesCode的使用优化。这两款模型分别承接的是普通用户日常需求和专业开发者的复杂需求。\n先来看下Agnes AI此次升级的AgnesCode平台。\n在用户体验方面，该平台完成首字生成时延（TTFT）优化。用户下发提示词后整体响应效率提升，连续编码、多轮智能体任务流转更加顺畅，保障Vibe Coding编写的心流不被加载卡顿干扰，高频改码、执行指令时的交互体验显著改善。\n除了桌面端升级，AgnesCode将于7月28日上线CLI功能，用户登录部署后，可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作；授权后还可直接运行终端指令、安装项目所需依赖。\n凭借模型的全栈能力迭代、分层定价策略、免费体验以及对AI工作台升级的组合策略，Agnes AI已经打通了从技术研发、用户沉淀到商业落地的完整链路。\n二、一手实测编程难题，直出复杂项目管理平台\n智东西提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。\n第一个轻量化模型是Agnes 2.5 Flash，其可以完成用户日常编程、Agent和高频开发任务，提升了代码理解、Bug修复、项目重构、多文件修改、多步骤任务执行和复杂推理等能力。\n与Agnes AI此前的定价策略一脉相承，该模型全面上线后将不限期免费开放，开发者可以通过AgnesCode或API调用。\n智东西先用Agnes-2.5 Flash做了一轮测试，输入提示词：搭建一个macOS桌面界面，自带文件管理、浏览器、笔记这类常用基础功能。\n可以看到，模型生成的界面整体视觉贴合原生macOS系统的经典UI风格，顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全，同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序，并且点击日历还能查看到对应的提醒事项，贴合真实系统的交互观感。\n另一道题目是让模型生成“一个完整响应式科幻风格个人博客网站”。\n整个网站的视觉风格统一，主标题设计了白色和紫色渐变的字体，符合科幻感，页面布局中自上而下采取了主标题、文章列表、博主个人介绍的排布，文章卡片使用半透明深色背景，主次分明。\n第二个是Agnes 2.5 Pro Alpha，这一模型在Agnes AI的模型矩阵中定位较为特殊。\n该模型是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本，支持100万Token超长上下文窗口，面向复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发等场景进行了优化。\nAgnes 2.5 Pro Alpha也是Agnes AI首款付费模型，当前API价格为每百万输入Token 0.45美元（约合人民币3.05元）、每百万输出Token 0.90美元（约合人民币6.09元）。用户可通过Agnes充值后调用API服务；同时，为降低专业用户体验门槛，模型上线后，用户可登录AgnesCode领取免费积分，体验Pro Alpha模型能力。\n智东西提出了一个进阶难题，要求Agnes 2.5 Pro Alpha“设计并实现一个企业级多租户SaaS项目管理平台”。\n首先在登录页，其完整设计了账号、密码、租户标识（Tenant Slug）输入框，精准对应多租户体系的登录鉴权逻辑。\n其次是后台界面，其采用了左侧导航栏、右侧内容区的企业后台布局，匹配项目管理平台的功能结构，并且组件化拆分、表单、筛选、卡片布局都属于成熟企业前端写法，静态页面的还原质量合格。\nAgnes-2.5 Pro Alpha作为先行体验版本，已经在复杂平台的构建方面展现出应用价值，再加上其Flash版本承接用户日常的高频业务调用，一普惠一旗舰的组合升级，适配当下AI应用的规模化落地。\n三、周token处理量超8万亿，调用数据印证模型商业化进展\n评判一款全模态大模型的技术成熟度，纸面参数、各类权威评测榜单固然有参考价值，但真实线上Token消耗结构是更为硬核的落地检验标准。\n依托真实线上业务沉淀的数据能直观反映用户真实使用偏好与模型实用价值，根据Agnes AI披露的最新数据，其全模态模型的单周Token处理量已经达到8.16万亿，其中文本Token达到5.1万亿，占总量的62.5%，多模态Token为3.06万亿，占总量的37.5%。\n这份Token配比数据释放出清晰信号，Agnes全模态模型的整体调用规模走高，多模态占比稳步提示，说明其图像、视频模块具备独立可用、稳定可靠的产品能力。用户实际业务场景实现了全覆盖，既包含文本对话、代码编写等传统刚需场景，也落地了图片处理、视频解析等多元多模态业务需求。\n这与当下AI产业趋势相关，如今头部模型比拼的核心落点，转向技术能力能否匹配用户真实需求、收获市场认可，并最终转化为真实调用流量。\n根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单，小米MiMo-V2.5以10.2T tokens位列第一，DeepSeek V4 Flash以6.01T tokens位列第二。对比两家行业头部玩家的数据，Agnes已经达到8.16万亿的周处理量级，其商业化规模跻身全球前列。\n模型体验比拼白热化的背后，行业竞争重心同步还向下游推理基建转移，SGLang作为支撑万亿级Token流转的核心开源框架，成为各大技术团队打磨硬核工程能力的关键。\nAgnes团队也在参与SGLang开源社区建设，目前已提交4项代码贡献，其中3项已正式合并，另有1项已通过维护者审核，正在完成后续测试与合并流程。\n结语：模型全方位升级落地，核心是对齐产业真实诉求\n头部大模型的能力比拼，正从文本模型的单一竞赛，转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时，全模态能力只有经过海量线上调用检验、份额稳步提升，才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。\nAgnes从模型、调用量、工具的全方位升级，也证明其模型的感知、理解、生成一体化能力已经真正匹配了产业实际需求。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-27/detail-inikhcmc0689815.d.html%3Fvt%3D4%26wm%3D1224%3Fpagetag%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3848 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3848 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3848,"summary_length":3848,"usable_text_length":3848,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3848,"summary_length":3848}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}