WPS AI表格评测超越国际主流大模型:办公场景的“应用层”赢了 - Sohu
Кратко: WPS AI表格评测超越国际主流大模型:办公场景的“应用层”赢了
近日,国际表格AI评测SpreadsheetBench更新V2 Full榜单,WPS AI以50.86%的综合成绩排名第一,并通过官方Verified验证。在该榜单中,WPS AI综合成绩一举超过Claude Opus 4.6、GPT-5.2、Gemini 3.1 Pro等国际主流AI模型。
这项评测关注AI对复杂表格的整体处理能力,包括理解、计算、排错、做图和最终交付。官方数据显示,V2共有321项任务,平均每项任务涉及11.8个工作表、593.5个单元格修改,最终考察的是AI能否把一份复杂工作簿完整处理并交付。
从这类表格任务的执行链路看,通常至少涉及三个环节:先识别表头、数据区域、公式引用和跨表关系;再对单元格、公式、格式、图表等进行实际操作;最后重新计算、检查引用和文件状态,确认结果可以继续使用。也就是说,复杂表格任务拼的不只是一次模型推理,还包括对文件结构的理解、对软件能力的调用和对结果的校验。
🧭 Извлечение: ok
· confidence 90%
· диагностика
High confidence: full text extraction produced 441 characters.
High confidence: full text extraction produced 441 characters.
WPS AI表格评测超越国际主流大模型:办公场景的“应用层”赢了
近日,国际表格AI评测SpreadsheetBench更新V2 Full榜单,WPS AI以50.86%的综合成绩排名第一,并通过官方Verified验证。在该榜单中,WPS AI综合成绩一举超过Claude Opus 4.6、GPT-5.2、Gemini 3.1 Pro等国际主流AI模型。
这项评测关注AI对复杂表格的整体处理能力,包括理解、计算、排错、做图和最终交付。官方数据显示,V2共有321项任务,平均每项任务涉及11.8个工作表、593.5个单元格修改,最终考察的是AI能否把一份复杂工作簿完整处理并交付。
从这类表格任务的执行链路看,通常至少涉及三个环节:先识别表头、数据区域、公式引用和跨表关系;再对单元格、公式、格式、图表等进行实际操作;最后重新计算、检查引用和文件状态,确认结果可以继续使用。也就是说,复杂表格任务拼的不只是一次模型推理,还包括对文件结构的理解、对软件能力的调用和对结果的校验。