# 刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网

*Источник: 搜狐网*
*Дата: 2026-07-24*
*Язык: zh*

**Кратко:** 刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由
新智元报道
Agentic AI，应该运行在什么样的计算底座上？
几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。
让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。
这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。
我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。
在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。
这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。
芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。
所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？
从一次推理到持续工作
Agent改变了端侧负载
聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。
Acrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。
这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。
这种工作方式首先放大了端云之间的分工。
单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。
因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。
真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。
它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。
端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。
只堆NPU不够
CPU、内存和软件栈必须一起重做
原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。
Acrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」
在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。
这也是Acrab少数值得展开的团队线索。
Ken Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。
这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。
Acrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。
硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。
Agent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。
Acrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。
公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。
总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。
其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。
融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。
从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。
恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。
700 TOPS之外
Prefill和数据通路决定真实体验
很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。
芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。
Agent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。
GΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。
按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。
Acrab称，后者可以将相关计算效率提高到三倍。
更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。
Acrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。
这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。
在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。
Acrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。
数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。
Acrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。
用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。
从芯片到平台
真正的竞争在参数之外
今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。
家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。
终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。
这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。
Acrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。
芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。
因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。
更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。
架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。
WAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。
Acrab押注的正是这一变化。
Agent Box不是终点，而是一次平台能力的公开测试。
端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。
秒追ASI

刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由
新智元报道
Agentic AI，应该运行在什么样的计算底座上？
几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。
让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。
这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。
我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。
在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。
这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。
芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。
所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？
从一次推理到持续工作
Agent改变了端侧负载
聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。
Acrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。
这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。
这种工作方式首先放大了端云之间的分工。
单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。
因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。
真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。
它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。
端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。
只堆NPU不够
CPU、内存和软件栈必须一起重做
原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。
Acrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」
在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。
这也是Acrab少数值得展开的团队线索。
Ken Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。
这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。
Acrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。
硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。
Agent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。
Acrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。
公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。
总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。
其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。
融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。
从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。
恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。
700 TOPS之外
Prefill和数据通路决定真实体验
很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。
芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。
Agent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。
GΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。
按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。
Acrab称，后者可以将相关计算效率提高到三倍。
更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。
Acrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。
这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。
在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。
Acrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。
数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。
Acrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。
用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。
从芯片到平台
真正的竞争在参数之外
今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。
家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。
终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。
这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。
Acrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。
芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。
因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。
更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。
架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。
WAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。
Acrab押注的正是这一变化。
Agent Box不是终点，而是一次平台能力的公开测试。
端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。
秒追ASI

[Оригинал](https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334)