14 个大模型同做一道量化题:谁写出了更好的交易策略?
本文整理自 frank-quant 的 YouTube 视频《做量化交易最好用的大模型(ChatGPT/Claude/DeepSeek/Grok/Gemini/GLM/Qwen)| Which Model Writes the Best Strategy?》及其公开实验仓库 ai-trading-videos/EP007_fourteen-llm-quant-benchmark。文章以视频英文字幕、仓库 README、RUNBOOK 和 results 目录中的结果文件交叉整理,不是视频逐字稿。
重要边界:这是一场单次实验和一次样本外回测,不是对模型长期交易能力的证明,也不是投资建议。视频和仓库都明确说明,整个过程使用 Freqtrade dry-run 模拟盘,没有使用真实资金。文中的收益、夏普、排名和成本均应理解为这次实验的结果,而不是未来收益保证。
先给结论
这场实验把 14 个主流大模型放进同一场量化交易考试:同一份题目、同一组 20 个交易对、同一份数据、同一笔手续费、同一个目标函数,并允许每个模型使用自己厂商的官方开发 harness 来完成策略设计、编码、搜索和回测。
实验最容易被标题带偏的地方,是“谁赢了”并不等于“谁真的找到了可稳定复制的交易优势”。从结果看:
- Qwen3.8-Max 综合排名第一,也是唯一一个在原始样本外回测中取得正收益的模型,收益为 +1.74%,样本外夏普为 +0.01。
- GPT-6 Astra@ultra 的工程质量最高,代码、交付物、因果检验和审计结果非常完整,但成本较高,最终综合排名第二。
- 14 个模型的样本外回测都跑赢了同期 20 币等权大盘,后者下跌 44.95%;但这并不意味着 14 个策略都赚钱,除 Qwen 外其余 13 个模型都以负收益结束。
- Qwen 的 +1.74% 中有 +2.68 个百分点来自回测末端的机械强平。剔除这部分后,Qwen 变成 −0.94%,因此剔除末端强平后全场没有模型保持正收益。
- 价格不能直接推导跨厂商能力。最贵的 Opus 5 成本约 ¥363.30,排名第 10;最便宜的 GLM-5.3-Flash 成本约 ¥0.70,排名第 11。不同厂商之间,价格与成绩几乎没有直接关系。
- 在同一家厂商内部,价格档位的差异相对更有解释力:GPT-5.6 的 Sol、Terra、Luna 大致按价格和表现排序;GLM-5.3 旗舰版也优于 Flash 版。
- 这场实验真正有价值的地方,不是证明某个模型“最会炒币”,而是展示了如何把模型生成的策略放进一套可审计、可复现、能检查未来函数和数据越界的实验流程。
视频和实验做了什么
视频标题是“哪个模型最适合写量化策略”,但实验并不是让模型回答一组理论题,而是要求它们完成一项完整的工程任务:在给定的 20 个交易对和 Freqtrade 框架中,自主设计、编码、搜索并提交一套同时支持做多和做空的交易策略。
每个模型需要交付:
- 策略源码;
- 配置文件和最终参数;
- 训练、验证指标;
design.md设计说明;self_assessment.md自评;run.md执行记录;- 超参数搜索结果。
为了尽量减少“模型不会用某个工具”带来的影响,作者没有让所有模型共用一个客户端,而是给不同模型匹配了各自的官方 harness:
| 厂商 | 模型 | 使用的 harness |
|---|---|---|
| 阿里 | Qwen3.8-Max | Qwen Code |
| OpenAI | GPT-6 Astra、GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna | Codex Desktop |
| DeepSeek | DeepSeek V4 Pro | DeepSeek Harness(dsh) |
| DeepSeek | DeepSeek V4 Flash | Codex CLI,沿用上一季结果 |
| 智谱 | GLM-5.3、GLM-5.3-Flash | ZCode |
| xAI | Grok 4.6 | Grok Build |
| Gemini 3.8 Flash | Antigravity CLI | |
| Anthropic | Opus 5、Fable 5 | Claude Code,沿用上一季结果 |
| 月之暗面 | Kimi K3 | Kimi Code,沿用上一季结果 |
合计是 14 个模型、8 家厂商、9 套 harness。其中 10 个模型在本季重新运行,上一季的 4 个模型使用相同 Docker 环境和数据冻结结果复用。
实验设计:公平性来自隔离,而不是一句提示词
训练、验证和样本外测试分离
实验把数据拆成三个阶段:
- Train:模型用于探索策略和参数;
- Validation:模型用于选择参数,但仍然属于开发阶段;
- Test:模型完成交卷后才揭盲的样本外数据。
最关键的设计是:样本外数据被放在模型工作目录之外。模型在训练和验证阶段看不到完整的未来数据,揭盲时才挂载包含 2025 年 7 月之后数据的完整数据目录。作者还扫描了日志和代码中的越界引用,避免模型通过文件系统直接找到测试集。
这比在提示词里写一句“不要看测试集”更可靠。对于能够自动执行命令、搜索文件和修改代码的 Agent,物理隔离比行为约束更容易审计。
回测窗口和市场环境
样本外测试覆盖 2025 年 7 月到 2026 年 7 月。在这段时间里,20 个交易对的等权大盘下跌约 44.95%,因此这是一次明显偏熊市的压力测试。
这带来两个同时成立的判断:
- 一个策略下跌 4% 到 20%,相对大盘仍然可能是“跑赢市场”;
- 但相对跑赢大盘,不等于策略本身具备可接受的绝对收益。
因此,本文同时报告绝对收益、相对大盘表现、夏普、最大回撤、alpha、beta 和多空拆分,避免只看一列数字。
六个评分维度
作者在发题前就固定了评分权重:
| 维度 | 权重 | 关注点 |
|---|---|---|
| 稳健性 | 25% | 蒙特卡洛、费率变化、盈利月份、回撤、训练与验证一致性等 |
| 样本外表现 | 25% | 样本外收益、夏普、回撤和交易质量 |
| 无作弊 | 15% | 未来函数、杠杆、手续费、测试集越界和双向交易检查 |
| 代码质量 | 15% | 交付物完整性、代码可读性、配置和参数可复现性 |
| 诚实报告 | 15% | 自报指标和独立复现是否一致,是否主动披露缺陷 |
| 性价比 | 5% | 运行成本、Token 消耗和最终综合分的关系 |
这个评分方式有一个重要含义:最终第一名不是单纯按收益排序。如果一个模型收益稍好,但代码、审计、交付和成本都很差,它不一定能拿到综合第一。
14 个模型的主榜
下表采用仓库中的主榜口径:主榜夏普使用 Freqtrade 的 Sharpe (daily wallet balance),收益为样本外回测的 profit_total。费用是本次运行的实验成本,其中订阅制工具的部分费用是按 Token 量和目录价格折算的等效成本,不一定等于用户实际支付的套餐价格。
| 排名 | 模型 | 样本外夏普 | 样本外收益 | 最大回撤 | p 值 | 搜索轮数 | 成本 |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8-Max | +0.01 | +1.74% | 10.15% | 0.901 | 300 | ¥7.57 |
| 2 | GPT-6 Astra@ultra | −0.23 | −4.95% | 22.38% | 0.749 | 160 | ¥92.38 |
| 3 | GPT-5.6 Sol | −0.25 | −4.02% | 19.70% | 0.779 | 300 | ¥28.82 |
| 4 | GPT-5.6 Terra | −0.60 | −6.22% | 19.78% | 0.622 | 60 | ¥10.58 |
| 5 | DeepSeek V4 Flash | −0.62 | −7.09% | 13.48% | 0.613 | 500 | ¥1.04 |
| 6 | Fable 5 | −0.62 | −7.54% | 23.08% | 0.526 | 300 | ¥94.90 |
| 7 | Gemini 3.8 Flash | −0.75 | −10.99% | 22.03% | 0.173 | 300 | ¥74.74 |
| 8 | GLM-5.3 | −1.38 | −19.87% | 22.18% | 0.164 | 400 | ¥8.88 |
| 9 | DeepSeek V4 Pro | −1.40 | −21.05% | 23.99% | 0.153 | 400 | ¥3.55 |
| 10 | Opus 5 | −1.42 | −19.56% | 24.28% | 0.148 | 300 | ¥363.30 |
| 11 | Grok 4.6 | −1.92 | −19.11% | 23.20% | 0.115 | 80 | ¥20.81 |
| 12 | GPT-5.6 Luna | −2.01 | −23.29% | 36.02% | 0.043 | 120 | ¥2.25 |
| 13 | GLM-5.3-Flash | −2.39 | −22.44% | 22.39% | 0.022 | 597 | ¥0.70 |
| 14 | Kimi K3 | −3.71 | −29.78% | 33.23% | 0.0008 | 398 | ¥15.62 |
主榜的第一层结论是:14 个模型全部跑赢了 −44.95% 的同期大盘,但只有 Qwen3.8-Max 收盘时仍为正。第二层结论是:Qwen 的 +1.74% 并不意味着它已经证明自己拥有稳定 alpha,p 值为 0.901,统计上无法把这次正收益与运气清晰区分开。
逐组分析:模型到底做对了什么、做错了什么
OpenAI:Astra 工程质量最好,但成本拉低综合排名
四个 OpenAI 模型都在 Codex Desktop 中运行,GPT-5.6 三个档位使用 high,GPT-6 Astra 特意使用了更高的 ultra。
四个模型都通过了硬门槛:回测可以跑完,交易数量足够,同时存在多空交易,脚手架没有被偷偷改动,未来函数检查通过,也没有越界读取样本外数据。
性能上,四个模型全部负收益:
- GPT-6 Astra:夏普 −0.23,收益 −4.95%;
- GPT-5.6 Sol:夏普 −0.25,收益 −4.02%;
- GPT-5.6 Terra:夏普 −0.60,收益 −6.22%;
- GPT-5.6 Luna:夏普 −2.01,收益 −23.29%。
它们有一个共同点:都选择了 4 小时级别,没有模型选择 30 分钟或 1 小时;而且四个模型都提交了自己验证搜索中排名第一的参数。这样做并非违规,但会增加把验证集局部尖峰当成最终答案的风险。
GPT-6 Astra 的突出优势是工程质量。仓库评估认为它是全场交付物最完整、代码审计能力最强的一组,因果检查为 max|full−trunc| = 0,策略代码和自查文件也最完整。它没有拿到第一,核心原因是成本:本次等效成本约 ¥92.38,而性价比权重虽然只有 5%,仍然拖低了综合分。
GPT-5.6 Luna 则是一个反例:它的成本只有 ¥2.25,但样本外表现最差的 OpenAI 模型,主要因为净多头暴露较高。在深度熊市里,长仓亏损抵消了少量空头收益,最大回撤也达到 36.02%。
智谱:低换手带来费率韧性,但 Flash 版长期偏弱
GLM-5.3 和 GLM-5.3-Flash 都使用 ZCode,并采用日线级别。
GLM-5.3 的样本外收益为 −19.87%,夏普 −1.38;Flash 为 −22.44%,夏普 −2.39。两者的最大回撤接近,但 Flash 的胜率和 Profit Factor 更弱。
这组模型的一个有趣特征是换手率非常低:GLM-5.3 年化换手约 26 次,Flash 只有 7 次。作者把手续费翻倍到 12bp 后,两者仍保留了大约 97% 和 99% 的结果,说明它们的损失并不是主要由手续费造成的。
Flash 的自评里主动承认,自己提交的是 597 轮搜索中验证集最高的结果,并预期样本外夏普会明显低于验证集。这种自我折价没有改变它的回测结果,却提高了“诚实报告”维度的评分。
DeepSeek:Flash 更像被市场拖下去,Pro 更多是自己选错了币
DeepSeek V4 Flash 沿用上一季 Codex 的结果,DeepSeek V4 Pro 则是本季使用官方 harness 的新跑次。
- V4 Flash:样本外收益 −7.09%,夏普 −0.62,最大回撤 13.48%;
- V4 Pro:样本外收益 −21.05%,夏普 −1.40,最大回撤 23.99%。
两者的差异不只是收益数字不同。归因分析显示,V4 Flash 的年化 alpha 接近 0,它的损失主要来自市场 beta 拖累;换句话说,它没有明显额外地选错币,但在熊市中仍然承担了市场方向风险。
V4 Pro 的年化 alpha 约为 −18.7%,大部分损失来自模型自己的币种选择和策略方向,而不是市场单纯下跌。这个案例提醒我们:同一厂商的“新一代 Pro”不一定会在一次、单次、固定任务上稳定优于旧的 Flash 版本。
同时,V4 Pro 的成本仍然很低,约 ¥3.55;如果只看成本和工程实验,不看收益,它是一个很便宜的研究工具。但便宜并不能抵消策略本身的风险。
Grok 4.6:完成度高、速度快,但搜索预算偏小
Grok 4.6 在 Grok Build 中运行约 29 分钟,只搜索了 80 轮,是所有模型中较少的一组。它交付了完整的配置、参数和自评,并通过了硬门槛。
它的策略使用框架级数据接口,标准的未来函数检查无法直接判断,因此作者采用了逐根 K 线的替代检验:398 根 K 线中有 397 根信号一致,唯一差异来自短窗口在数据末端的边界效应,未被判定为真正的未来函数。
Grok 4.6 的样本外收益为 −19.11%,夏普 −1.92。它在空头方向赚到了一部分收益,但多头亏损更大。它的一个优点是自评中主动披露了两次 liquidation 和一次 −99% stop-loss,即使考题没有要求它必须这样写,这也被认为是诚实度上的加分项。
Gemini 3.8 Flash:训练和验证更一致,但几乎没有做空
Gemini 3.8 Flash 使用 Antigravity CLI,选择 4 小时级别并运行 300 轮。它的特殊之处是没有直接提交验证集第一名,而是主动退了 22 个名次,选择了训练和验证更接近的参数:自报训练夏普 0.83,验证夏普 0.84,差距只有 0.01。
这在方法论上是一个不错的信号:模型没有简单地把验证集最高分当成最终答案,而是尝试寻找更一致的参数。但它的实盘形态存在明显问题:总共 364 笔交易里只有 6 笔空单,占比约 1.6%,名义上是多空策略,实际接近多头策略。
在一个大盘下跌 44.95% 的测试期里,几乎不做空会天然承受 beta 拖累。Gemini 的年化 alpha 约为 −3.5%,说明选币本身并没有特别糟,但净敞口和方向暴露让它吃到了市场下跌的大部分影响。
它的交付物还缺少多个字段,也没有记录 seed,因此可复现性和合规性评分受到影响。这个例子说明:训练/验证一致性很好,不代表策略真的符合任务要求,更不代表样本外一定盈利。
Qwen3.8-Max:综合最均衡,但正收益需要拆解
Qwen3.8-Max 使用 Qwen Code,日线级别,运行 300 轮,并提交了搜索中的第一名参数。
它的原始样本外结果最好:收益 +1.74%,夏普 +0.01,最大回撤 10.15%,胜率 51.2%,Profit Factor 1.016。它也通过了完整的硬门槛,seed、最终参数和配置都写入了 config.json,代码和交付物较完整。
但 Qwen 的正收益必须放到末端强平问题里理解。Freqtrade 在回测结束时会把所有未平仓头寸机械平掉,Qwen 的 17 笔末端强平贡献了约 +2.68 个百分点。剔除后,Qwen 的收益为 −0.94%。
因此,准确的表述应该是:
Qwen3.8-Max 是原始回测中唯一的正收益模型,但这次正收益不足以证明可复制的 alpha;在剔除回测末端机械强平后,Qwen 也没有保持正收益。
它仍然拿到综合第一,是因为综合评分不仅看收益,还看稳健性、代码、诚实和成本等维度。这个排名逻辑是合理的,但不能把“综合第一”宣传成“稳定赚钱第一”。
最关键的横向结论
1. 所有模型都选择了较慢时间周期
14 个模型里,7 个选择日线,7 个选择 4 小时,没有一个选择 30 分钟或 1 小时。视频把原因归结为交易成本:时间周期越短,换手和手续费越容易吃掉策略收益。
这并不意味着更慢的时间周期一定更好,而是说明在没有明确高频优势、没有低延迟执行环境和没有更精细滑点模型时,模型普遍会避开过快的策略。
2. 12 个模型沿用了横截面脚手架
考题提供了一个横截面策略基类,但没有强迫模型使用。最终 12 个模型沿用了它,只有 Grok 4.6 自己写了横截面策略,Gemini 3.8 Flash 使用了逐币趋势跟踪。
这说明脚手架具有很强的路径依赖:即使题目允许自由选择策略族,大多数 Agent 仍然倾向于从可运行、已有接口和示例策略开始。脚手架不是中性的,它会影响搜索空间、代码结构和最终策略类型。
3. 搜索轮数没有用满,更多计算不一定带来更好结果
考题把搜索上限设为 2000 轮,但实际运行范围只有 60 到 597 轮,没有模型用到上限的三分之一。作者观察到,大多数收敛曲线在模型停止时已经趋于平坦,继续搜索可能只会增加过拟合风险。
这也解释了为什么“模型更聪明”不必然等于“搜索更多”:如果目标函数、验证集或策略空间本身不够稳定,增加搜索轮数可能只是更快地找到验证集噪声。
4. 14 个模型全部跑赢大盘,但只有一个绝对收益为正
这是最容易被误读的一条:
- 相对基准:14 个模型都比 −44.95% 的等权大盘跌得少;
- 绝对结果:13 个模型仍然亏损,只有 Qwen3.8-Max 在回测结束时略微为正。
在熊市里,“少亏”可能来自更低的净敞口、部分做空或更低的 beta,而不一定代表模型找到了稳定的 alpha。因此,报告必须同时看绝对收益和归因结果。
5. 正 alpha 只有四家,且不等于正收益
归因分析显示,只有四个模型产生了正的年化 alpha:
| 模型 | 年化 alpha |
|---|---|
| Fable 5 | +7.8% |
| Qwen3.8-Max | +5.9% |
| GPT-5.6 Sol | +4.2% |
| GPT-5.6 Terra | +2.7% |
即使 alpha 为正,若 beta 拖累足够大,最终收益仍可能为负。GPT-5.6 Sol 和 Terra 就是例子:它们有正 alpha,但在熊市 beta 拖累下仍然亏损。
6. 做空能力是熊市环境里的重要分水岭
14 个模型的多头部分全部亏损,空头部分有 11 个模型赚钱。空头收益最高的是 GPT-5.6 Sol,约 +22.5%。Gemini 3.8 Flash、GLM-5.3-Flash 和 Kimi K3 的空头部分几乎没有贡献。
但这不意味着“熊市只要做空就能赚钱”。2025 年 11 月大盘下跌 14.93%,七家策略全部亏损;2025 年 10 月大盘也跌了 16.54%,却有四家策略盈利。市场状态不是一个单变量开关,空头、选币、持仓周期、止损和执行成本必须一起看。
末端强平:Qwen 正收益为什么需要打一个问号
Freqtrade 在回测结束时会把所有未平仓头寸强制平掉,这是一种回测结束机制,并不是策略主动发出的信号。它对大多数模型都有影响:剔除末端强平后,14 家中的 11 家结果变差。
| 模型 | 含强平收益 | 强平贡献 | 剔除后收益 |
|---|---|---|---|
| Qwen3.8-Max | +1.74% | +2.68% | −0.94% |
| GPT-6 Astra | −4.95% | +0.68% | −5.63% |
| GPT-5.6 Sol | −4.02% | +0.46% | −4.49% |
| Fable 5 | −7.54% | +0.65% | −8.19% |
| GPT-5.6 Terra | −6.22% | +2.32% | −8.54% |
| DeepSeek V4 Flash | −7.09% | +1.64% | −8.74% |
| Gemini 3.8 Flash | −10.99% | −0.27% | −10.72% |
| GLM-5.3 | −19.87% | +1.03% | −20.90% |
| DeepSeek V4 Pro | −21.05% | −1.11% | −19.94% |
| Opus 5 | −19.56% | +1.01% | −20.57% |
| GPT-5.6 Luna | −23.29% | +2.00% | −25.30% |
| Grok 4.6 | −19.11% | +1.80% | −20.91% |
| GLM-5.3-Flash | −22.44% | −0.05% | −22.39% |
| Kimi K3 | −29.78% | +3.92% | −33.71% |
三个判断需要同时保留:
- 强平并不是 Qwen 独有的问题,很多模型都受到了影响;
- Qwen 的符号确实依赖强平,+1.74% 会变成 −0.94%;
- 剔除强平后全场没有正收益,因此原始榜单不应被包装成“模型已经学会稳定赚钱”。
成本:贵不等于好,便宜也不等于差
这场实验的费用跨度超过 500 倍:
- Opus 5:约 ¥363.30;
- Fable 5:约 ¥94.90;
- GPT-6 Astra:约 ¥92.38;
- GLM-5.3-Flash:约 ¥0.70;
- DeepSeek V4 Flash:约 ¥1.04。
如果把 14 个模型放在一起比较,价格与最终成绩基本没有线性关系。最贵的 Opus 5 排名第 10,最便宜的 GLM-5.3-Flash 排名第 13,但它们都不能说明“贵的一定更强”或“便宜的一定更划算”。
更可信的结论出现在同厂商内部:
| 同厂商档位 | 成本 | 样本外夏普 | 结果顺序 |
|---|---|---|---|
| GPT-5.6 Sol | ¥28.82 | −0.25 | 最好 |
| GPT-5.6 Terra | ¥10.58 | −0.60 | 中间 |
| GPT-5.6 Luna | ¥2.25 | −2.01 | 最弱 |
| GLM-5.3 | ¥8.88 | −1.38 | 优于 Flash |
| GLM-5.3-Flash | ¥0.70 | −2.39 | 低于旗舰 |
也就是说,同一家厂商的更高档位可能确实购买了更多推理能力,但不同厂商之间不能把价格当成统一的能力尺度。
按综合分与成本画出的 Pareto 前沿只有三个模型:Qwen3.8-Max、DeepSeek V4 Flash 和 GLM-5.3-Flash。其余模型都能找到一个更便宜且综合分更高的替代者,至少在这次实验的成本口径下如此。
这场实验的方法学优点
1. 把模型输出当成可审计的软件交付物
模型不是只给一段策略代码就结束,而是必须提交配置、参数、执行记录、自评和搜索结果。这样才能检查它是否真的执行了自己的方法,是否修改了脚手架,是否能被第三方复现。
2. 把未来函数和数据越界单独拿出来检查
量化回测最危险的错误往往不是语法错误,而是策略偷偷读到了未来信息。实验使用截断数据和全量数据做因果对比,同时检查代码、日志和目录边界。
3. 把模型的自报数字和独立重跑分开
模型自报的训练和验证夏普不直接作为最终结果。作者重新运行策略,并区分 Freqtrade 控制台口径和目标函数口径,避免把不同计算方式的夏普混在一起。
4. 不只看收益,还看成本、回撤和代码质量
如果只按收益排序,模型可能通过极端参数、过度搜索或偶然持仓得到一个看起来漂亮的数字。加入稳健性、诚实度、无作弊和代码质量,能让结果更接近“工程上可用的研究候选”,而不是一次投机性的最高分。
这场实验仍然有哪些局限
每个模型只运行一次
这是最重要的限制。每个模型只有一次完整考试,无法估计同一个模型在不同随机种子、不同上下文、不同运行顺序下的方差。因此,相邻名次之间的差距很可能小于重复实验的噪声。
比较稳妥的解读是分成三档:
- 头部:Qwen3.8-Max、GPT-6 Astra、GPT-5.6 Sol;
- 中段:Terra、DeepSeek V4 Flash、Fable 5、Gemini 3.8 Flash、GLM-5.3、DeepSeek V4 Pro、Opus 5;
- 尾部:Grok 4.6、GPT-5.6 Luna、GLM-5.3-Flash、Kimi K3。
不应把 Sol 比 Terra 高 0.35 个夏普写成稳定能力差异,也不应把 Flash 比 Fable 的微小差距写成可靠结论。
测试年份是熊市,不是中性样本
样本外大盘下跌 44.95%,这对做空、低净敞口和防守型策略有利,对长期做多策略不利。如果换成震荡市或牛市,模型排序可能完全不同。
20 个币存在幸存者偏差
仓库明确披露,测试的 20 个交易对是站在今天回头选择的,不能代表所有可交易资产。若把已经退市、流动性极差或历史数据不完整的资产纳入,结果可能改变。
滑点模型仍然理想化
实验使用固定的手续费和简化的滑点设置,没有完整模拟市场冲击、盘口深度、排队位置、成交延迟和资金费率。对于高换手或小市值资产,真实执行成本可能明显高于回测。
订阅型产品的成本不是实际账单
Codex、Claude Code 等订阅制工具无法像按量 API 一样直接得到每一次调用的真实边际账单,因此部分成本按 Token 量乘以公开目录价格折算。这个数字适合做相对比较,不应当被理解为用户购买套餐后真的支付了同样金额。
目标函数存在可被利用的缺陷
四个模型独立发现,目标函数对验证集表现的惩罚方向存在空档:某些情况下,模型可以在规则允许范围内选择验证集高分但训练集不够一致的参数。这个发现本身很重要,因为它展示了 Agent 不只是在执行题目,也会主动分析评分函数,并在评分函数存在缺口时优化它。
但从实验设计角度看,这也说明下一轮应该改进目标函数,把训练/验证一致性、搜索选择偏差和样本外稳健性更严格地纳入考题,而不是只在考后解释。
如果要复现,建议按这个顺序
仓库提供了完整 RUNBOOK,复现时不要只运行一次回测然后相信模型提交的 metrics.json。一个更可靠的顺序是:
- 固定 Freqtrade Docker 镜像版本;
- 为每个模型创建互相隔离的工作目录;
- 在交卷前只挂载训练和验证数据;
- 交卷后再挂载样本外数据;
- 重新运行 train、valid、test 三段回测;
- 使用相同策略源码复核未来函数和测试集越界;
- 翻倍手续费,检查策略是否依赖低成本假设;
- 拆分多头和空头收益、alpha 和 beta;
- 单独识别末端
force_exit,不要把机械强平当作策略信号; - 最后再生成汇总排名。
尤其要注意时间区间的结束时间。仓库的口径说明记录了一次典型错误:把 2026-06-30 解析成当天 00:00,可能切掉最后一整天,导致 Qwen 的结果从正变负。任何回测脚本都应该把最终 profit_total 和成交明细重新对账,不能因为脚本没有报错就认为窗口正确。
对 GPT88 用户的实际启示
如果你想使用 GPT88 或其他模型辅助研究量化策略,这场实验给出的建议不是“直接选第一名模型实盘”,而是建立更严格的研究闭环:
- 把模型放在研究、代码生成和假设提出的位置;
- 让确定性的回测、风险计算、仓位限制和交易执行系统负责最终判断;
- 每次模型生成代码后都做未来函数、数据边界、手续费、滑点和多空对称性检查;
- 不要把验证集最高分直接当成最佳参数;
- 记录模型 ID、推理档位、提示词、seed、工具调用和实际成本;
- 用多次重复实验和不同市场状态验证结论;
- 在没有经过实盘前置检查、影子运行和人工审批前,不要把回测结果自动接入真实账户。
GPT88 的价值更适合体现在:为研究流程提供稳定的模型入口、在多个模型之间切换、统一记录请求和成本、帮助生成审计材料,而不是用一个模型回答“哪套策略一定赚钱”。
最终评价
这不是一场证明“大模型可以替代量化研究员”的实验。相反,它展示了大模型在量化研究中最现实的能力边界:
- 模型可以独立完成相当复杂的策略编码、参数搜索和文档交付;
- 模型可以发现目标函数缺陷,并在规则范围内优化搜索目标;
- 模型可以写出通过未来函数和数据越界检查的策略;
- 但一次回测里的正收益仍可能来自偶然、环境偏差或回测机制;
- 代码质量、审计能力和报告诚实度,往往比某个最高收益数字更值得关注。
如果一定要把视频压缩成一句话,可以这样说:
14 个模型同做一张量化交易试卷,只有一个模型在原始样本外回测中没有亏损;但把回测最后一天的机械强平剔除后,所有模型都没有保持正收益。
这句话既保留了实验的戏剧性,也没有把一次熊市回测包装成可复制的投资能力。
原始资料
- 视频:YouTube:做量化交易最好用的大模型
- 实验仓库:frank-quant/ai-trading-videos
- 实验目录:EP007_fourteen-llm-quant-benchmark
- 结果总表:EP007_参赛名单与排名.md
- 强平敏感性:EP007_剔除强平后排名.md
- 复现说明:RUNBOOK.md
අදාළ මාර්ගෝපදේශය
GPT-6 Astra 模型能力、适用场景与评测