登录路演时代
忘记密码
忘记密码
忘记密码
欢迎注册路演时代
已有账号?马上登陆
国金金融工程 DeepSeek-V4-Pro 测评
发布来源: 路演时代 时间: 2026-08-17 14:21:19 0

1、V4-Pro正式版基础配置与Agent能力

基础配置与技术架构:本次推出的版本为Viz Pro 0813,整体采用MoE架构,总参数达1.6T,单token激活参数为49B。模型原生支持100万token上下文,API最大输入长度为384k。技术优化层面,引入流行约束超连接方案提升深层网络信号传播稳定性,采用MUON优化器提升收敛效率,以MP4、FP8混合精度发布。工程接口方面支持OpenAI相关协议接口,涵盖Chat Completion、Responses、SOTopic三类,具备JSON输出、工具调用等常规功能。

Agent能力测评表现:本次版本最核心的能力升级方向为Agent能力:a. 与预览版对比,在HLE工作工具增强、terminal bench、DBSWE等多个基准测试上的能力提升均超20%,其中DBSWE评分提升3倍多,本次升级重点修补了真实代码仓库修改、长程执行的短板,并非仅提升知识问答分数;b. 与国内外同类模型对比,在七项共同Agent基准测评中,算术平均得分为65分,与Kimi K3的65.1分持平,高于Opus 4.8的63.9分GLM-5.2的53分,仅略低于CloudFusion 5的67.6分,整体Agent能力接近行业顶尖水平。


2、V4-Pro正式版定价与成本优势

定价策略调整情况:V4-Pro正式版价格较预览版上涨3倍8月17日前预览版百万token输出价格为6元,定价相较于当前国内外同类模型处于极低水平。8月17日起正式版实施峰谷定价机制,区分空闲、高峰时段计费:空闲时段百万token输出价格为13.5元,较预览版上涨两倍多;高峰时段百万token输出价格为27元,较预览版上涨四倍多。

同类模型成本对比:基于百万输入未命中、二十万输出的长程Agent任务场景,按1美元兑换7人民币的汇率换算,V4-Pro空闲时段成本为7.2元,高峰时段成本为14.4元;同期同类模型成本分别为:VS Flash对应时段2.4元/4.8元GLM 5.2为13.6元Kimi K3为42元Opus 4.8为70元Fibo 5为140元。在效果与同类模型表现相近的前提下,V4-Pro空闲时段成本为同类模型最低,仅为Kimi K3的17%Opus 4.8的10%;即便处于高峰时段,其成本也仅为Kimi K3的34%,虽经历涨价但仍具备十分明显的成本优势。


3、DeepSeek Harness插件功能价值

插件核心定位与架构:Hunyuan是位于大模型和业务工具之间的Agent运行时,核心功能包括将模型输出转化为工具调用,管理上下文、文件、沙箱、会话、重试及多Agent编排,同时记录完整执行轨迹。其开发者预览版采用一切皆插件的开放架构,由Cod插件系统提供插件加载、卸载、依赖管理服务,以及基于服务和事件的协作机制。

插件化价值与预置模式:插件化架构带来两方面核心价值:a. 实现模型与执行环境解耦,同一套业务工具和流程可切换viss pro、viss flash或其他模型,也可替换沙箱、存储和上下文策略,降低对单一闭源平台的绑定风险;b. 实现Agent能力可组件化复用Agent能力从系统赤字工程升级为可组合软件组件,机构可将数据库权限、Excel建模规范、研报引用规则和合规风险检查封装为插件或技能,在不同任务中复用。DeepSeek Harness预置标准模式、PD模式、最小化模式、创造者模式四类模式,不同模式并非能力区分,而是不同执行环境和工作工具权限的组合。此外VES PRO正式版竞争力已从单点模型效果转向Agent能力及与HANIS系统协同,成本优势虽有所削弱,但相较于Kimi K3、OPPO四点八等产品仍具备显著成本优势。


4、金融投研场景实测表现

估值建模任务表现:估值建模任务以中际旭创为研究对象,要求模型自主获取历史财务、最新经营数据,完成经营预测、三张报表搭建、DCF及相对估值模型构建,输出敏感性分析与投资报告,核心检验业务判断转化为财务假设的能力,保障收入、利润、现金流、估值逻辑联动,Excel模型、研究报告、目标价、投资评级结果一致。本次测试对比DeepSeek-V4 Pro、Kimi K3、GLM-5.2三款国产模型,各模型接收完全相同的结构化提示词。三款模型表现差异如下:a. Kimi K3表现最优,收入采用分产品销量乘单价拆解方式,拆分800G、400G及其他产品,分别列示各产品销量与单价假设,预测颗粒度最细;b. DeepSeek-V4 Pro报告逻辑自洽、结论保守,交付Excel估值模型、投资价值分析报告及配套假设说明、数据来源清单,收入拆分为光模块和其他业务,增速锚点比Kimi K3更明确,但未搭建销量×单价分产品模型,未说明客户资本开支需求与产能对销量的映射,Excel公式存在错位,经营预测表后四年无法承接上期收入,成本费用多处复制2026年全年估计,模型不支持修改数据后自动更新;c. GLM-5.2底稿可用性差,核心公式异常,收入增速、EPS、相对估值结果无法正常计算。该任务下模型推荐优先级为Kimi K3>DeepSeek-V4 Pro>GLM-5.2。

多因子回测任务表现:多因子回测任务基于沪深300实际成分股开展,测试区间为2011年1月至2026年6月共186个调仓期,要求构建价值、质量、动量、低波动四类因子,完成IC、Rank IC、分组收益、多因子回测、多因子选股全流程,核心要求包含正确处理历史成分股、行业分类、财务披露、复权价格、调仓时点、不可交易状态等细节,三款模型接收统一结构化提示词。三款模型表现差异如下:a. DeepSeek-V4 Pro表现最优,考虑交易滞后性(收盘生成信号次日成交)、扣除交易成本,基于真实换手率给出毛利润、净利润两套净值,构建4类共8个因子,经MAD去极值、行业中心化、标准化后用IC、Rank IC、十分组收益检验单因子,交付多因子研究报告、Python流水线代码、Excel回测底稿,全计算链路可追溯,仅未纳入涨跌停字段建模,未剔除涨跌停不可交易场景,回测可执行性存在高估可能;b. Kimi K3报告结构更完整,但未扣除交易成本;c. GLM-5.2既未扣除交易成本,也未剔除涨跌停等不可交易情况。该任务下模型排名为DeepSeek-V4 Pro>Kimi K3>GLM-5.2。

行业研究任务表现:行业研究任务以半导体设备产业链为研究对象,要求模型检索行业与公司资料,梳理上游零部件、中游设备、下游晶圆制造环节,建立海外龙头与国内公司对应关系,输出行业数据库、投资框架、跟踪指标、风险分析,沉淀Wiki知识库支撑投研平台搭建。三款模型表现差异如下:a. DeepSeek-V4 Pro表现最优,交付Markdown、HTML格式半导体设备行业深度报告、可更新行业Wiki,数据来源与口径说明齐全,覆盖光刻、涂胶显影、刻蚀、薄膜沉积、离子注入、清洗、CMP、量测、封装测试等核心环节,国内主体包含北方华创、中微公司等,海外龙头覆盖ASML、应用材料、泛林科技、东京电子等,明确海内外公司映射关系,投资框架从市场空间、成长速度、技术壁垒、盈利能力、竞争格局、估值6个维度打分,知识库沉淀完整可复用;b. Kimi K3表现次之,行业覆盖面小于DeepSeek-V4 Pro;c. GLM-5.2覆盖面最窄。该任务下模型排名为DeepSeek-V4 Pro>Kimi K3>GLM-5.2。


5、产品综合评价与推荐

综合竞争力总结:DeepSeek-V4-Pro(DV SP PRO)定价虽较自身上涨3-4倍,但在价格波谷阶段,收费相较于国内同阶模型、海外模型仍具备显著成本优势。三项金融投研任务测试中,DeepSeek-V4-Pro(DV SP PRO)综合表现最优:仅估值任务稍弱于Kimi K3,回测任务、行业研究任务表现均排名第一。该模型Agent能力表现优异,整体性价比突出,推荐尝试使用其正式版本。

Q&A

Q:DeepSeek V4-Pro正式版的发布时间、版本号及基础技术参数是什么?

A:DeepSeek V4-Pro正式版于8月13日在各终端、APP、网页端及API同步上线,版本号为V4-Pro 0813。模型采用MoE架构,总参数1.6T,单token激活参数49B,原生支持100万token上下文,API最大输入长度384k。工程上采用MP4与FP8混合精度发布,支持OpenAI协议接口,具备JSON输出与工具调用能力。

Q:DeepSeek V4-Pro正式版在agent能力方面有哪些提升?在哪些benchmark上表现如何?

A:DeepSeek V4-Pro正式版重点强化agent能力,在HLE工作工具增强、terminal bench、DPSWE等benchmark上较预览版提升均超20%,其中DPSWE评分提升超三倍。更新聚焦修补真实代码仓库修改与长程执行短板,而非仅提升知识问答分数。

Q:DeepSeek V4-Pro正式版在agent能力上与哪些竞品模型进行了对比?对比结果如何?

A:在七项共同agent基准测试中,DeepSeek V4-Pro算术平均得分为65,与Kimi-K3基本持平,高于Opus 4.8和GLM-5.2,略低于CloudFusion 5,整体能力处于行业前列。

Q:DeepSeek V4-Pro正式版的API定价策略是怎样的?与预览版相比有何变化?成本优势如何?

A:自8月17日起实施峰谷定价:空闲时段百万token输出价格13.5元,高峰时段27元,较预览版分别上涨约2.25倍与4.5倍。在百万输入、二十万输出的长程agent任务中,空闲时段成本7.2元、高峰时段14.4元,仍显著低于Kimi-K3、Opus 4.8和Fibo 5,空闲时段成本为Kimi-K3的17%、Opus 4.8的10%,高峰时段为Kimi-K3的34%,保持明显成本优势。

Q:DeepSeek最新发布的Harness插件的主要思想、核心价值及预置模式是什么?

A:Harness定位为大模型与业务工具间的Agent运行时,负责将模型输出转化为工具调用,管理上下文、文件、沙箱、会话、重试及多Agent编排,并记录完整执行轨迹。采用一切皆插件开放架构,由Cod插件系统提供加载、卸载与依赖管理。核心价值在于:实现模型与执行环境解耦,便于切换模型或替换组件;将Agent能力升级为可组合软件组件,支持封装数据库权限、Excel建模规范等业务规则复用。预置标准模式、PD模式、最小化模式与创造者模式,差异在于执行环境与工具权限组合。

Q:在估值建模任务中,DeepSeek V4-Pro正式版的表现如何?与GLM-5.2和Kimi-K3相比如何?

A:以中际旭创为研究对象的估值任务中,DeepSeek V4-Pro交付估值模型Excel、投资报告及数据来源清单等完整材料,报告逻辑自洽、结论审慎,但Excel存在公式错位问题。收入预测采用业务拆分加总方式,未建立分产品销量乘单价模型。综合表现:Kimi-K3最佳,DeepSeek V4-Pro次之,GLM-5.2底稿可用性较差。

Q:在多因子回测任务中,DeepSeek V4-Pro正式版的表现如何?与GLM-5.2和Kimi-K3相比如何?

A:基于沪深300成分股的回测任务中,DeepSeek V4-Pro正确处理交易滞后性,考虑交易成本并输出毛利与净利润两套净值,交付因子研究报告、Python代码及详细Excel底稿。但未建模涨跌停限制。综合排名:DeepSeek V4-Pro第一,Kimi-K3次之,GLM-5.2表现较弱。

Q:在半导体设备行业研究任务中,DeepSeek V4-Pro正式版的表现如何?与GLM-5.2和Kimi-K3相比如何?

A:DeepSeek V4-Pro交付Markdown/HTML格式深度报告及可更新行业Wiki,覆盖光刻、刻蚀等全环节,梳理北方华创、中微公司等国内企业与ASML、应用材料等海外龙头映射关系,投资框架从市场空间、技术壁垒等六维度打分。知识库沉淀实体数量与报告完整性优于竞品。综合表现:DeepSeek V4-Pro最佳,Kimi-K3次之,GLM-5.2相对较弱。

Q:综合三个金融投研任务,DeepSeek V4-Pro正式版的整体竞争力与推荐结论是什么?

A:DeepSeek V4-Pro正式版通过agent能力提升与Harness系统,将竞争力从单点模型效果扩展至执行系统层面。尽管API价格较预览版上涨,峰谷定价下成本优势依然显著。在金融投研实测中,回测与行业研究任务均排名第一,仅估值任务略逊于Kimi-K3,综合表现最佳,推荐作为高性价比选择。

 温馨提示:内容源于第三方以及公开平台,仅供用户参考,恕本平台对内容合法性、真实性、准确性不承担责任。如有异议/反馈可与平台客服联系处理(微信:_LYSD_)