{"id":45179,"topic":"ai","source":"搜狐网","title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"86ac55df40febe330dcf07fbb5a636eca6224c53","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxQMHk3S3hBM3JGSVdCQXF6QWVsSWhSYzRMano5ajd0SEpLLXBXSG5OV0dDWkNaR0VCRFUxT1UzWFdCSVMyUV9HYXN3bU1KcXhuQ1JlVDYzQ0JXMk5MLUZHRGVIbVdtLVUtNUpaS2pBS2I1ejA5YkkwN3N0ODYyekNCWmNxdHE4VHBW?oc=5\" target=\"_blank\">刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">搜狐网</font>","content":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","image_url":"https://q9.itc.cn/q_70/images03/20260724/96e746b7e9224402b5d063238ed41389.jpeg","lang":"zh","published_at":"2026-07-24T07:51:27+00:00","fetched_at":"2026-07-24T09:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","cluster_id":1681626,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}},"news_item":{"id":45179,"canonical_url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","source_name":"搜狐网","author":null,"published_at":"2026-07-24T07:51:27+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxQMHk3S3hBM3JGSVdCQXF6QWVsSWhSYzRMano5ajd0SEpLLXBXSG5OV0dDWkNaR0VCRFUxT1UzWFdCSVMyUV9HYXN3bU1KcXhuQ1JlVDYzQ0JXMk5MLUZHRGVIbVdtLVUtNUpaS2pBS2I1ejA5YkkwN3N0ODYyekNCWmNxdHE4VHBW?oc=5\" target=\"_blank\">刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">搜狐网</font>","full_text":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","excerpt":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4335 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","source":"搜狐网","date":"2026-07-24T07:51:27+00:00","content":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4335 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/45179","export_markdown":"/api/items/45179/export?format=markdown","export_json":"/api/items/45179/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":45179,"title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"搜狐网","author":null,"published_at":"2026-07-24T07:51:27+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","full_text":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4335 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}},"actions":{"read":"/item/45179","export_markdown":"/api/items/45179/export?format=markdown","export_json":"/api/items/45179/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":45179,"title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"搜狐网","topic":"ai","published_at":"2026-07-24T07:51:27+00:00","excerpt":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 新智元报道 Agentic AI，应该运行在什么样的计算底座上？ 几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。 让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 4335 characters.","reading_time_min":1,"cluster_id":1681626},"card":{"display_title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","subtitle":"搜狐网 · 2026-07-24","summary":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 新智元报道 Agentic AI，应该运行在什么样的计算底座上？ 几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。 让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。…","badges":["quality:high"],"links":{"read":"/item/45179","original":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由 - 搜狐网","url":"https://m.sohu.com/a/1054306612_473283?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","source":"搜狐网","date":"2026-07-24T07:51:27+00:00","content":"刚刚，亚洲黑马交卷了！把千亿大模型搬回本地，迈向Token自由\n新智元报道\nAgentic AI，应该运行在什么样的计算底座上？\n几天过去，WAIC 2026上最拥挤的概念之一——Agent Computer——开始从展台上的新鲜感，变成一道真正的工程题。\n让一台设备在本地跑起大模型，已经不算最难的部分。更难的是，当Agent要持续读取文件、保留记忆、调用工具，并在后台长期运行时，芯片能否在功耗、延迟和成本的约束下保持稳定。\n这会改写端侧芯片的评价方式。TOPS、模型参数和每秒Token仍然重要，但如果内存带宽跟不上、CPU与NPU协同不顺、软件栈无法维持任务状态，再漂亮的峰值也可能只够完成一次Demo。\n我们注意到，本周，新加坡公司Acrab举行了一场线上发布会，并发布了Agent Box，这也许给出了一个可供拆解的样本。\n在这场发布会里，这家AI Infra公司把Prefill、统一内存、CPU-NPU异构协同和Agent编排同时摆上了台面。\n这些关键词指向同一个判断： 端侧AI正在从「运行一个模型」，走向「长期运行一套智能系统」。\n芯片要解决的，也不再只是算力够不够，而是数据如何流动、任务如何调度、软硬件如何持续协同。\n所以，当WAIC的热闹和新品发布、行业趋势逐渐沉淀下来，真正值得追问的问题反而更清楚了：当Agent从一次调用变成持续工作之后，端侧芯片究竟要重做什么？\n从一次推理到持续工作\nAgent改变了端侧负载\n聊天机器人通常完成一轮问答。Agent接到一个任务后，可能先搜索资料、读取文件，再调用代码、浏览器、日历或办公软件；完成一部分后检查结果，保留任务状态，等待下一次触发。一次任务往往涉及多轮模型调用，也会在不同模型、工具和应用之间反复切换。\nAcrab在发布会中展示了一个相对完整的任务流程：用户提出想为孩子制作一份太空主题礼物，系统继续给出创意、协助选择方案、调用相关工具并跟进制作进度；当环境里出现新的状况，它又可以连接其他智能设备进行处理。\n这段演示的意义不在于某一次回答有多聪明， 而在于一句自然语言能否被转化为一串连续动作。对于计算系统来说，Agent不再只是「调用一次模型」，而是在模型、数据、软件和设备之间持续切换。\n这种工作方式首先放大了端云之间的分工。\n单次推理的费用可能不高，但调用变得高频、持续之后，Token就会从技术指标变成真实账单；一次网络等待对聊天影响有限，放进多步任务中却会逐层累积；Agent要掌握更完整的个人上下文，数据反复往返云端，也会扩大暴露面。\n因此，端侧和云端并不是非此即彼。更加现实的结构是： 高频、隐私敏感、需要快速响应和长期保持状态的任务尽可能留在本地；超过设备能力边界的复杂推理，再调用云端资源。\n真正的变化在于，端侧不再只承载一次模型推理，而要承载一套不能轻易中断的智能系统。\n它既要运行大模型，也要处理长上下文、多任务和工具调用；性能必须足够强，功耗和成本又不能失控，Runtime、工具链和Agent生态也必须同时跟上。\n端侧大模型解决的是模型能不能装进设备，Agentic AI要解决的，则是模型、记忆、工具和应用能不能在设备里长期协同。\n只堆NPU不够\nCPU、内存和软件栈必须一起重做\n原因在于，Agent并不是一条固定的神经网络推理链路。大规模并行计算适合交给NPU，任务拆解、条件判断、系统调度、工具调用、异常处理和多系统协作，则高度依赖CPU。任务路径越动态，CPU与NPU之间的协调就越重要。\nAcrab CEO Ken Phua将这种变化概括为： 「CPU再次回到AI时代的中心。」\n在他的判断中， AI正在进入异构计算环境，执行效果不只取决于NPU性能，更取决于CPU与NPU能否无缝协同。\n这也是Acrab少数值得展开的团队线索。\nKen Phua曾在Arm UK带领亚太应用工程团队，并参与全球IP策略制定，之后担任Arm China联席CEO。\n这段经历的意义并不只是行业履历，而是 解释了这家公司为什么会从CPU架构、异构计算和真实应用需求的交叉位置，重新定义Agent工作负载。\nAcrab没有把GΞLIX 1定义为一颗传统AI处理器，而是将它作为端侧AI时代的计算平台。\n硬件侧以GΞLIX 1为核心；软件侧覆盖大模型、优化后的Runtime、完整工具链，以及连接模型、工具、设备和服务的Agent编排层；在此基础上，公司还提供面向典型场景的Agent参考设计，帮助开发者和生态伙伴更快构建应用。\nAgent Box则是这套软硬件平台第一次以完整产品形态出现。它被定义为Personal AI Center，可以在本地运行千亿参数级模型，即使没有网络连接，也能保持核心能力。\nAcrab取自Agentic Compute、Reasoning、Action与Brain的首字母，也恰是天文学中一个多恒星系统的名字——正 如其设计哲学：让不同的计算单元，像恒星系统一样协同运转。\n公司以此为目标，为Agent打造一颗能思考与行动的大脑，构筑下一代计算平台。\n总部位于新加坡的Acrab，已累计融资超过3.5亿美元，投资方包括淡马锡旗下全球风投平台Vertex（祥峰投资）、新加坡知名科技投资机构K3 Ventures等。\n其第一代计算平台GΞLIX已经在要求严苛的真实部署环境中完成验证，目前正走向首次行业导入和规模化生产。\n融资可以为重工程购买时间，但真正决定路线能否成立的，仍然是系统能否交付。\n从这个角度看，「CPU重新回到中心」并不意味着NPU不再重要。\n恰恰相反，它意味着AI计算已经复杂到，无法再依靠一颗孤立的加速器解决所有问题。\n700 TOPS之外\nPrefill和数据通路决定真实体验\n很多时候，大模型推理的瓶颈并不只是计算单元不够快，而是数据来不及送到计算单元。\n芯片即使拥有很高的峰值算力，如果内存带宽跟不上，NPU仍然要停下来等待。\nAgent会进一步放大数据搬运问题。它需要频繁读取历史记录，在不同模型和软件之间传递数据，并持续保存任务状态。每一次复制都会增加延迟和功耗，任务运行得越久，系统设计的重要性就越高。\nGΞLIX 1的设计重点，正是把模型需要的数据尽量留在距离计算单元更近的位置，并减少CPU、NPU、内存和不同操作系统之间的来回搬运。\n按照Acrab公开的架构，GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的统一内存带宽，芯片内部配置8MB L1 Cache、带宽达到768GB/s的共享L2 Cache、四颗并行NPU核心，以及针对Attention计算设计的专用加速模块。\nAcrab称，后者可以将相关计算效率提高到三倍。\n更大的片上缓存，可以让关键数据离计算单元更近；共享L2 Cache让参数和中间特征在计算单元之间高效共享；统一内存架构则减少模型、操作系统和应用之间不必要的数据复制。\nAcrab还采用多系统统一内存架构，让不同操作系统更高效地共享内存。对于只运行一个模型的设备，这可能只是效率优化；对于需要不断跨应用、跨工具工作的Agent，它会直接影响任务能不能顺畅推进。\n这也解释了为什么Acrab把Prefill放到发布会的中心位置。Agent在引入新文件、恢复任务状态或更新上下文时，往往需要再次处理新增信息。任务链越长，Prefill效率对整体体验的影响就越明显。\n在Acrab披露的一组自测中，GΞLIX 1运行260亿参数Gemma模型，使用40K KV Cache和1万Token输入，Prefill速度超过每秒1416个Token；在相同负载下，其表现是某主流通用桌面平台的7倍以上。\nAcrab还将GΞLIX 1与一款同类桌面级AI计算平台放在同一测试框架下比较。\n数据显示，GΞLIX 1在Prefill和Decode两项核心指标上进入相近的性能区间，同时呈现出更低的功耗和更具竞争力的整机成本。\nAcrab选择强调Prefill和数据通路，本身说明了一种产品取向：端侧Agent芯片不能只追求模型输出得有多快，还要解决模型能否快速读懂长上下文、恢复任务状态并开始工作。\n用户不会关注一条推理链路内部经过了多少层缓存，也不会在每次交互前查看TOPS。用户真正感受到的只有三件事：它能否迅速理解、能否持续运行，以及拥有它是否足够划算。\n从芯片到平台\n真正的竞争在参数之外\n今年WAIC出现的Agent Computer、个人AI中心和企业端侧设备，还没有形成统一的产品形态。\n家庭场景更强调个人记忆、内容和设备协同，企业场景更看重知识库、文件处理和内部数据安全。不同客户对模型大小、内存容量、功耗和接口的要求差别很大。\n终端越碎片化，计算平台就越难做。一颗芯片很难只靠参数覆盖所有场景，还需要提供Runtime、模型适配、开发工具和Agent框架，帮助客户把底层算力转化为能够交付的产品。\n这也是Agentic AI芯片比普通推理芯片多出来的一道题： 芯片性能决定模型能不能运行，软件栈决定开发者能不能把它用起来，Agent生态则决定设备最终能够完成什么任务。任何一层缺失，都可能让一颗参数漂亮的芯片停留在Demo阶段。\nAcrab试图把这些环节同时抓在手里。好处是产品定义更加完整，风险也很直接：战线很长。\n芯片要证明性能、稳定性和规模化交付能力，软件栈要追上模型的快速迭代，Agent编排层还要兼容不断变化的工具和应用。个人文件和长期记忆留在本地之后，权限隔离、插件安全和操作审计也必须同步解决。\n因此，Acrab能否成为Agentic AI时代的计算平台，最终不取决于发布会上跑出了多少Token，也不取决于Agent Box能够演示多少个任务。\n更关键的验证是：开发者能否在这套平台上快速做出产品；Agent连续工作数小时之后，性能、功耗和稳定性能否同时成立；当模型和Agent框架继续变化时，底层软硬件能不能跟上。\n架构创新决定一家芯片公司的能力上限，工程化和生态则决定这个上限能不能变成订单。\nWAIC上密集出现的新终端，说明 行业正从「把大模型跑起来」走向「让Agent持续工作」。前一阶段比算力、内存和模型大小；下一阶段还要解决长上下文、个人记忆、工具调用与多任务协同。\nAcrab押注的正是这一变化。\nAgent Box不是终点，而是一次平台能力的公开测试。\n端侧芯片需要「重做」，不是因为TOPS不重要，而是Agent正把计算从峰值数字变成长期运行的系统能力。它能否成立，最终要看这套芯片、软件和终端能否进入真实工作流。\n秒追ASI","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1054306612_473283%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4335 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4335 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4335,"summary_length":4335,"usable_text_length":4335,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4335,"summary_length":4335}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}