# 大模型混战正酣，谁来告诉投资人哪个AI真能做投研？ - SOHU

*Источник: SOHU*
*Дата: 2026-07-30*
*Язык: zh*

**Кратко:** 大模型混战正酣，谁来告诉投资人哪个AI真能做投研？
作者 | 熵简科技 AlphaEngine AI团队
这可能是国产大模型史上最热闹的一个七月。
Kimi K3 发布即刷屏，被华尔街机构定性为"DeepSeek 2.0 时刻"；DeepSeek V4 实测视频流出，"对标 Opus 4.8""压过 GPT-5.6"的说法满天飞；千问3.8 预览版也已悄悄上线。新模型一周一个，榜单分数天天刷新。
但对每天要出报告、做决策的投研人来说，真正的问题只有一个—— 这些模型，到底哪个真能干投研的活？
通用榜单答不了这个问题。为此， 熵简科技 AlphaEngine AI团队历时数年建设并持续维护了 IRB（Investment Research Benchmark）投研能力评测体系——目前金融投研场景公认的权威AI测评基准。它的题目不来自教科书，而来自熵简科技服务 9000 家金融机构过程中沉淀的"投研错题集"：那些让资深分析师犯过错、让主流模型反复翻车的真实案例。
为什么投研必须有自己的标尺
看看这些模型是怎么"证明自己"的：Kimi K3 拿的是前端代码榜单第一，DeepSeek V4 流出的实测是生成3D射击游戏、"0.12美元写出3000行代码"。

大模型混战正酣，谁来告诉投资人哪个AI真能做投研？
作者 | 熵简科技 AlphaEngine AI团队
这可能是国产大模型史上最热闹的一个七月。
Kimi K3 发布即刷屏，被华尔街机构定性为"DeepSeek 2.0 时刻"；DeepSeek V4 实测视频流出，"对标 Opus 4.8""压过 GPT-5.6"的说法满天飞；千问3.8 预览版也已悄悄上线。新模型一周一个，榜单分数天天刷新。
但对每天要出报告、做决策的投研人来说，真正的问题只有一个—— 这些模型，到底哪个真能干投研的活？
通用榜单答不了这个问题。为此， 熵简科技 AlphaEngine AI团队历时数年建设并持续维护了 IRB（Investment Research Benchmark）投研能力评测体系——目前金融投研场景公认的权威AI测评基准。它的题目不来自教科书，而来自熵简科技服务 9000 家金融机构过程中沉淀的"投研错题集"：那些让资深分析师犯过错、让主流模型反复翻车的真实案例。
为什么投研必须有自己的标尺
看看这些模型是怎么"证明自己"的：Kimi K3 拿的是前端代码榜单第一，DeepSeek V4 流出的实测是生成3D射击游戏、"0.12美元写出3000行代码"。

[Оригинал](https://m.sohu.com/a/1056756587_120988576?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334)