📥 Content Hub
← назад
AI / Искусственный интеллект SOHU zh 2026-07-30 09:18 1 min

大模型混战正酣,谁来告诉投资人哪个AI真能做投研? - SOHU

Кратко: 大模型混战正酣,谁来告诉投资人哪个AI真能做投研? 作者 | 熵简科技 AlphaEngine AI团队 这可能是国产大模型史上最热闹的一个七月。 Kimi K3 发布即刷屏,被华尔街机构定性为"DeepSeek 2.0 时刻";DeepSeek V4 实测视频流出,"对标 Opus 4.8""压过 GPT-5.6"的说法满天飞;千问3.8 预览版也已悄悄上线。新模型一周一个,榜单分数天天刷新。 但对每天要出报告、做决策的投研人来说,真正的问题只有一个—— 这些模型,到底哪个真能干投研的活? 通用榜单答不了这个问题。为此, 熵简科技 AlphaEngine AI团队历时数年建设并持续维护了 IRB(Investment Research Benchmark)投研能力评测体系——目前金融投研场景公认的权威AI测评基准。它的题目不来自教科书,而来自熵简科技服务 9000 家金融机构过程中沉淀的"投研错题集":那些让资深分析师犯过错、让主流模型反复翻车的真实案例。 为什么投研必须有自己的标尺 看看这些模型是怎么"证明自己"的:Kimi K3 拿的是前端代码榜单第一,DeepSeek V4 流出的实测是生成3D射击游戏、"0.12美元写出3000行代码"。
🧭 Извлечение: ok · confidence 90% · диагностика
High confidence: full text extraction produced 532 characters.

大模型混战正酣,谁来告诉投资人哪个AI真能做投研?

作者 | 熵简科技 AlphaEngine AI团队

这可能是国产大模型史上最热闹的一个七月。

Kimi K3 发布即刷屏,被华尔街机构定性为"DeepSeek 2.0 时刻";DeepSeek V4 实测视频流出,"对标 Opus 4.8""压过 GPT-5.6"的说法满天飞;千问3.8 预览版也已悄悄上线。新模型一周一个,榜单分数天天刷新。

但对每天要出报告、做决策的投研人来说,真正的问题只有一个—— 这些模型,到底哪个真能干投研的活?

通用榜单答不了这个问题。为此, 熵简科技 AlphaEngine AI团队历时数年建设并持续维护了 IRB(Investment Research Benchmark)投研能力评测体系——目前金融投研场景公认的权威AI测评基准。它的题目不来自教科书,而来自熵简科技服务 9000 家金融机构过程中沉淀的"投研错题集":那些让资深分析师犯过错、让主流模型反复翻车的真实案例。

为什么投研必须有自己的标尺

看看这些模型是怎么"证明自己"的:Kimi K3 拿的是前端代码榜单第一,DeepSeek V4 流出的实测是生成3D射击游戏、"0.12美元写出3000行代码"。

Читать оригинал ↗

Сделать контент из этого материала