{"id":83823,"topic":"ai","source":"第一财经","title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","url":"https://www.yicai.com/news/103367106.html","url_hash":"dff30a3e622162564fc7b806c410833862318f4a","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiU0FVX3lxTE1GbERndHlIcV9ELU5kazBOOWRsZGk3UndiWVlkQ3NlWFJxc2pfSzQzNDQ5b21vSUx2b0dtbFA2NEVBTS16R0k0SlF1YkI0ekJERmxz?oc=5\" target=\"_blank\">平安银行自研大模型路由算法登顶国际权威评测榜单</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">第一财经</font>","content":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","image_url":null,"lang":"zh","published_at":"2026-09-16T12:14:37+00:00","fetched_at":"2026-09-16T14:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.yicai.com/news/103367106.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}},"news_item":{"id":83823,"canonical_url":"https://www.yicai.com/news/103367106.html","source_url":"https://www.yicai.com/news/103367106.html","title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","source_name":"第一财经","author":null,"published_at":"2026-09-16T12:14:37+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiU0FVX3lxTE1GbERndHlIcV9ELU5kazBOOWRsZGk3UndiWVlkQ3NlWFJxc2pfSzQzNDQ5b21vSUx2b0dtbFA2NEVBTS16R0k0SlF1YkI0ekJERmxz?oc=5\" target=\"_blank\">平安银行自研大模型路由算法登顶国际权威评测榜单</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">第一财经</font>","full_text":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","excerpt":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2207 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","url":"https://www.yicai.com/news/103367106.html","summary":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","source":"第一财经","date":"2026-09-16T12:14:37+00:00","content":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2207 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/83823","export_markdown":"/api/items/83823/export?format=markdown","export_json":"/api/items/83823/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html"},"formats":{"full":{"id":83823,"title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","url":"https://www.yicai.com/news/103367106.html","source":"第一财经","author":null,"published_at":"2026-09-16T12:14:37+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","full_text":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2207 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}},"actions":{"read":"/item/83823","export_markdown":"/api/items/83823/export?format=markdown","export_json":"/api/items/83823/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html"}},"digest":{"id":83823,"title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","url":"https://www.yicai.com/news/103367106.html","source":"第一财经","topic":"ai","published_at":"2026-09-16T12:14:37+00:00","excerpt":"{{aisd}} AI生成 免责声明 近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。 平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2207 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","subtitle":"第一财经 · 2026-09-16","summary":"{{aisd}} AI生成 免责声明 近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。…","badges":["quality:high"],"links":{"read":"/item/83823","original":"https://www.yicai.com/news/103367106.html","diagnose":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html"},"quality_warning":null},"export":{"title":"平安银行自研大模型路由算法登顶国际权威评测榜单 - 第一财经","url":"https://www.yicai.com/news/103367106.html","summary":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","source":"第一财经","date":"2026-09-16T12:14:37+00:00","content":"{{aisd}}\nAI生成 免责声明\n近期，平安银行自主研发的大模型路由算法Paix2登顶RouterArena，在最新榜单中以77.63分位列第一，并已连续近一个月保持榜首。这一成绩，标志着平安银行在 AI 自主创新方面实现新的突破。\n平安银行已系统性建设了“1+1+1+N”的AI能力支撑体系，通过统一的算力基座、统一的算法基座、统一的数据知识基座，以及N个业务场景应用，构建全方位、多层次、一体化的人工智能生态。Paix2的技术突破，进一步丰富了平安银行统一算法基座的技术储备，也为推动AI赋能业务场景提供了新的技术支撑。\n并非每一个任务，都需要旗舰大模型\nRouterArena是国际上具有代表性的大模型路由公开评测平台，由美国莱斯大学计算机科学系研究团队推出，平台通过标准化数据集和统一评测框架，从准确率、调用成本、模型选择能力、鲁棒性、延迟等多个维度，对不同大模型路由方案进行综合评估，其评测框架相关研究成果已发表于人工智能领域顶级国际学术会议ICLR 2026。目前，榜单已汇集Microsoft、UC Berkeley等全球知名科技企业和顶尖院校的路由方案，是当前大模型路由领域具有较高参考价值的公开竞技场之一。\n在这个赛场上，各位“选手”要解决的问题只有一个：如何为每一项任务挑选最合适的大模型？\n实际生活中，用户的问题千差万别：上一个问题可能是“什么是账单日”，下一个又变成“帮我分析这份几十页的行业报告，并提炼关键结论”。前者只需要基础的知识问答能力，后者则需要长文本理解、信息提取和综合推理能力。\n过去的常见做法是“一个大模型通吃”：只要大模型足够强，就用它解决所有问题。但这样做，一方面容易造成算力浪费；另一方面，让复杂模型处理简单问题，也可能增加响应时间，影响使用体验。\n大模型路由提供了另一种思路：先判断任务的特点和难度，再交给更合适的模型——简单问题交给“小而快”的模型，复杂问题调用能力更强的模型。既避免“杀鸡用牛刀”，也不让真正的难题陷入“小马拉大车”。\n换句话说，RouterArena考验的，不只是回答的准确率，还包括模型调用的成本，以及模型选择的准确性。如何在效果与成本之间找到更优解，是“选手们”拉开差距的关键。\n从榜单来看，Paix2的优势在于有效平衡了“答得准”、“花得少”和“选得对”。一方面，准确率保持在较高水平。在同样的测评框架下，Paix2的准确率为79.7%，与榜单上准确率最高的算法仅相差0.07个百分点；另一方面，调用成本显著降低。每千次查询成本为0.27美元，较榜单上准确率最高的算法降低约61%。这说明，在回答效果几乎相当的情况下，Paix2大幅降低了调用大模型的成本。\n不仅如此，Paix2模型选择能力同样优秀，它的最优模型选择得分达到89.67，最优准确率得分达到100。这代表，面对不同任务，Paix2能准确为其匹配到更为合适的模型。\n那么，Paix2究竟是如何为每一个任务找到更合适的选择？\n三个步骤，找到“对”的大模型\n要做选择，首先要有“可选项”。在此次RouterArena评测中，Paix2配置了4个候选模型，包括MiniMax-M3、Agnes 2.0 Flash、DeepSeek-R1-0528-Qwen3-8B和GLM-4-9B-0414。这些模型并非简单的强弱关系，而是各有侧重，有的擅长复杂推理，有的擅长快速响应。Paix2的任务，就是将问题与能力各异的模型准确配对。\n平安银行数字金融发展办公室总经理兼总工程师周仁丹与团队内多位工程师，围绕这一技术问题持续探索，最终形成“BERT + 专家规则 + 经典推荐模型”的三位一体架构。先用BERT深度理解用户查询的语义和意图；再通过专家规则，守住业务的硬约束和边界条件；最后由推荐模型综合考虑性能与成本，完成全局最优匹配，选出合适的大模型。\n一次选择看似简单，但当AI需要处理的任务越来越多、越来越复杂时，如何持续做出合适的选择，就直接影响整个AI系统的运行效率。\n从榜单前列，到业务一线\nAI规模化应用，需要建立在稳固的地基之上。Paix2解决的，正是AI基础设施中的模型调用与算力资源配置问题。对于每天面对海量、多元业务需求的商业银行而言，这是一个非常实际的命题。\n在商业银行，不同业务的任务千差万别：既有高频、标准化的信息查询，也有需要理解大量材料、进行综合分析判断的复杂任务；既有规则明确的流程性工作，也有需要动态处理的开放性任务。当这些任务越来越多地交由AI处理，如何为不同任务匹配合适的模型，也就成为商业银行推进AI规模化应用必须解决的问题。\n近年来，在“AI in All”的战略下，平安银行持续推动AI深入各类业务一线，助力提升员工工作效率，优化客户服务体验。周仁丹表示，Paix2已在数字员工“小派同学”应用落地，并逐步拓展至平安银行内部的多个AI场景。当AI以更稳健、更可持续的方式进入更多场景，才有惠及更多人的可能。对平安银行而言，技术从来不是终点。无论是模型能力的突破，还是底层基础设施的不断优化，最 终都要回到“N个业务场景应用”的真实需求，回到员工与客户的实际体验。\n未来，平安银行将持续深耕AI核心技术，坚持守正创新，让更先进的技术能力加速融入业务场景，让AI创新真正转化为有用、有效的实际价值，为每一位用户带来更高效、更贴心的金融服务体验。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.yicai.com/news/103367106.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2207 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2207 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2207,"summary_length":2207,"usable_text_length":2207,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2207,"summary_length":2207}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}