【AI论文】StockBench:大型语言模型(LLM)智能体能否在现实市场中进行盈利性股票交易?

摘要:近期,大型语言模型(LLMs)作为自主智能体展现出了强大的能力,在推理、工具使用和序列决策方面展现出巨大潜力。尽管先前的基准测试已在软件工程和科学发现等领域对大型语言模型智能体进行了评估,但金融领域尽管与经济价值和高风险决策直接相关,却仍未得到充分探索。现有的金融基准测试主要通过问答来检验静态知识,但未能捕捉到交易的动态性和迭代性特点。为填补这一空白,我们推出了StockBench——一个无污染的基准测试,旨在在逼真的、为期数月的股票交易环境中对大型语言模型智能体进行评估。智能体每日接收市场信号,包括价格、基本面数据和新闻,并必须做出连续的买入、卖出或持有决策。其表现通过累计收益率、最大回撤和索提诺比率等金融指标进行评估。我们对最先进的专有模型(如GPT-5、Claude-4)和开放权重模型(如Qwen3、Kimi-K2、GLM-4.5)的评估显示,虽然大多数大型语言模型智能体难以超越简单的买入并持有基准策略,但仍有几个模型展现出了实现更高回报和更有效管理风险的潜力。这些发现凸显了开发基于大型语言模型的金融智能体所面临的挑战与机遇,表明在静态金融知识任务上的出色表现并不一定能转化为成功的交易策略。我们将StockBench作为开源资源发布,以支持研究的可重复性,并推动该领域未来的研究发展。Huggingface链接:Paper page,论文链接:2510.02209
研究背景和目的
研究背景:
随着大型语言模型(LLMs)在自然语言处理领域的快速发展,它们不仅在文本生成、问答系统等静态任务中表现出色,还逐渐展现出作为自主智能体的潜力,能够在复杂环境中进行推理、工具使用和顺序决策。然而,尽管已有多种基准测试评估了LLMs在不同领域的能力,如软件工程(如SWE-Bench、SWE-Agent)和科学发现(如GAIA),但在金融领域,尤其是针对LLMs作为自主智能体在动态市场环境中进行股票交易的能力评估仍然不足。现有的金融基准测试主要集中于静态知识问答,如FinQA、TAT-QA和FinBench,这些测试虽然能够评估LLMs的金融知识覆盖面,但无法反映实际交易场景中的动态性和迭代性。
研究目的:
为了填补这一研究空白,本研究旨在引入一个名为STOCK BENCH的新型基准测试,用于评估LLMs作为自主智能体在真实世界股票交易环境中的盈利能力和风险管理能力。STOCK BENCH的设计遵循了三个关键原则:现实性、连续性和无污染性。
通过提供一个包含历史市场数据、公司基本面信息和新闻头条的回测环境,STOCK BENCH能够模拟真实世界的交易场景,使LLMs智能体能够在连续的时间范围内做出交易决策,并直接评估其交易策略的有效性和风险调整后的收益。
研究方法
1. 基准测试设计:
STOCK BENCH由两部分组成:一个回测环境和一个关联的股票交易智能体工作流程。
- 回测环境:包含历史市场数据、公司基本面信息和新闻头条,模拟真实世界的股票交易。数据收集自2025年3月至6月,确保无数据污染,即评估期间的数据未在LLMs的训练过程中出现过。
- 股票交易智能体工作流程:将LLMs转换为交易智能体,使其能够在回测环境中进行交易决策。工作流程包括四个阶段:投资组合概览、深入股票分析、决策生成和执行与验证。
2. 评估指标:
采用三个广泛使用的金融指标来评估LLMs智能体的交易性能:
- 累计回报:衡量投资组合从初始金额到最终金额的百分比变化。
- 最大回撤:量化投资组合价值从峰值到谷底的最大跌幅,反映下行风险。
- Sortino比率:风险调整后的收益指标,仅惩罚下行波动。
3. 实验设置:
- 模型选择:评估了多种LLMs,包括专有模型(如GPT-5、Claude-4)和开源模型(如Qwen3、Kimi-K2、GLM-4.5)。
- 被动基准:采用等权重买入持有策略作为参考点,反映被动指数跟踪行为。
- 数据收集:从道琼斯工业平均指数(DJIA)中选取20只高权重股票作为投资目标,确保行业多样性和数据透明性。
研究结果
1. LLMs智能体的交易能力:
实验结果表明,尽管大多数LLMs智能体在静态金融知识测试中表现优异,但在动态市场环境中,它们很难超越简单的买入持有基准。
然而,部分模型如Kimi-K2和GPT-OSS-120B在某些时间段内展现出了更高的回报和更有效的风险管理能力。
2. 风险管理能力:
所有测试模型的最大回撤均低于被动基准,表明LLMs智能体能够在市场下跌期间更好地管理风险。
特别是Kimi-K2模型,在保持较低最大回撤的同时,实现了较高的累计回报。
3. 投资目标大小的影响:
随着投资目标数量的增加,所有模型的性能均有所下降,表现为平均回报降低和回报波动性增加。
然而,较大规模的模型如Kimi-K2在面对多资产决策时表现出更强的稳健性。
4. 信息源的重要性:
新闻和基本面数据对交易决策均有重要影响。移除新闻数据会显著降低模型的累计回报,而同时移除新闻和基本面数据则会导致性能进一步恶化。这表明,LLMs智能体在做出交易决策时需要综合利用多种信息源。
研究局限
1. 数据时间范围的限制:
尽管研究采用了最近的市场数据以避免数据污染,但四个月的数据窗口可能不足以全面评估LLMs智能体在不同市场条件下的表现。
未来研究应考虑更长时间范围的数据,以捕捉市场周期性变化的影响。
2. 模型多样性的不足:
尽管评估了多种LLMs,但所有模型均基于Transformer架构。
未来研究应探索其他架构的模型,如循环神经网络(RNN)或图神经网络(GNN),以评估不同模型在股票交易任务中的表现。
3. 交易成本的忽略:
当前研究未考虑交易成本(如佣金和滑点)对交易策略的影响。
在实际交易中,这些成本可能显著影响交易策略的盈利能力。未来研究应将交易成本纳入评估框架,以提供更现实的性能评估。
未来研究方向
1. 扩展数据时间范围:
收集并分析更长时间范围的市场数据,以评估LLMs智能体在不同市场周期下的表现。
这将有助于理解模型在面对市场波动和趋势反转时的适应性和稳健性。
2. 探索多样化模型架构:
评估不同架构的模型在股票交易任务中的表现,包括RNN、GNN和其他新兴架构。
这将有助于发现更适合金融交易的模型结构,并推动LLMs在金融领域的应用发展。
3. 引入交易成本模型:
在回测环境中引入交易成本模型,以更准确地评估交易策略的实际盈利能力。这将促使研究人员开发更高效的交易策略,以在考虑成本的情况下实现更高的风险调整后收益。
4. 增强信息融合能力:
探索更有效的信息融合方法,使LLMs智能体能够更好地利用新闻、基本面和其他相关信息源。
这将有助于提高模型的决策质量,并在动态市场环境中实现更稳定的交易性能。
5. 开发实时交易系统:
基于STOCK BENCH的研究成果,开发能够实时接收市场数据并做出交易决策的智能体系统。
这将推动LLMs在金融领域的实际应用,并为投资者提供新的交易工具和策略。
更多推荐
所有评论(0)