[论文阅读] 人工智能 + 软件工程 | 1085个AI编码插件+361条真实评论:用户到底在抱怨什么?
1085个AI编码插件+361条真实评论:用户到底在抱怨什么?
论文信息
- 原标题:“My productivity is boosted, but …” Demystifying Users’ Perception on AI Coding Assistants
- 主要作者及机构:
- Yunbo Lyu、Jieke Shi、Yue Liu、David Lo(新加坡管理大学)
- Zhou Yang(阿尔伯塔大学)
- Jianming Chang(东南大学)
- 引文格式(APA):Lyu, Y., Yang, Z., Shi, J., Chang, J., Liu, Y., & Lo, D. (2025). “My productivity is boosted, but …” Demystifying users’ perception on AI coding assistants. arXiv preprint arXiv:2508.12285v1.
- 发布时间:2025年8月17日
一段话总结
本文通过分析VS Code Marketplace中1085个AI编码助手插件的5908条用户评论(抽样361条),构建了包含8大类别、16个子类和62个标签的用户反馈分类体系,揭示了开发者对AI编码助手的真实态度:既认可其提升效率的价值,也吐槽建议冗余、上下文理解差、资源消耗高等问题,并据此提出了5项改进建议,为AI编码助手的优化提供了接地气的方向。
思维导图

研究背景
AI编码助手(如GitHub Copilot)已经成为很多开发者的“搭档”,它们能自动补全代码、修复bug、生成测试用例,号称能“加速开发”。但实际使用中,开发者可能花一半时间验证AI的建议——比如AI生成的代码看似正确,却隐藏着逻辑漏洞;或者频繁弹出不相关的提示,反而打乱思路。
过去的研究要么是在实验室里让开发者模拟 coding(环境不真实),要么只盯着 GitHub Copilot 一个工具(视角太窄),要么只收集技术大佬在GitHub Issues里的吐槽(忽略了新手和普通用户)。就像想了解一款手机好不好用,只问了数码博主,却没听普通消费者的声音——这显然不够全面。
而VS Code作为全球74%开发者在用的IDE,其插件市场里有大量AI编码助手,用户评论直接来自日常工作场景,堪称“开发者真实心声数据库”。这篇论文就盯上了这个数据库,想搞清楚:开发者到底觉得这些AI助手哪里好、哪里糟?
创新点
- 数据来源接地气:首次大规模分析VS Code Marketplace的真实用户评论,覆盖1085个AI插件,包含新手、非技术用户等“被忽略的声音”。
- 分类体系更全面:不仅关注技术问题(如bug),还包含用户体验(如界面设计)、价格、伦理等之前被忽视的维度(比如“用开源代码训练却收费”的争议)。
- 对比视角独特:横向对比32个不同AI助手的用户反馈,而不是只盯着单个工具(如GitHub Copilot)。
研究方法和思路
步骤1:筛选AI编码助手
- 从VS Code Marketplace的66053个插件中,用4种方法找AI相关插件:
- 官方搜索“AI”关键词
- 筛选“AI”“Chat”“Machine Learning”分类
- 匹配“ai”“gpt”“copilot”等标签
- 扫描插件描述中的55个AI相关关键词(如“large language model”)
- 用人工+GPT-4o验证(精度和召回率超96%),最终确定1085个AI插件。
步骤2:选择分析样本
- 挑出32个“有代表性”的插件:要么安装量高(前30名,占总安装量95.3%),要么评论多(超100条)。
- 从5908条评论中排除太短(<10字)的,随机抽361条(满足95%置信度+5%误差),翻译非英文评论。
步骤3:构建分类体系
- 4位研究者手动标注评论,用“自下而上”的方式合并标签:
- 先给每条评论贴标签(如“建议准确”“内存消耗高”)
- 合并相似标签,形成62个叶子节点
- 再归类到16个子类、8个大类(如“功能性”“可用性”“价格”)。
步骤4:情感分析
- 给每个标签标注“喜欢”“讨厌”“中性”(如“建议准确”是喜欢,“冗余输出”是讨厌),最终计算各维度的情感倾向。

主要贡献
| 贡献类型 | 具体内容 |
|---|---|
| 数据层面 | 识别出VS Code中1085个AI编码助手,发现90%是2023-2024年发布(爆发式增长),且头部10个插件占86%安装量(垄断明显)。 |
| 理论层面 | 构建8大类、16子类、62标签的用户反馈分类体系,覆盖功能、体验、价格等维度(可直接用于其他AI工具的用户研究)。 |
| 发现层面 | 6项关键发现: 1. 新手更认可AI助手,资深开发者更挑剔 2. 建议准确性最受重视,但冗余/不完整是常见槽点 3. 上下文理解差(如“记不住之前的对话”)是大痛点 4. 复杂的入门流程会让用户放弃 5. 资源消耗高(CPU/内存)但响应速度可接受 6. 免费工具更受欢迎,伦理问题(如“用开源数据赚钱”)影响 adoption |
| 实践层面 | 5项改进建议: 1. 优化上下文感知(如代码库索引) 2. 加强聊天/代理界面的交互设计 3. 简化入门流程,减少资源消耗 4. 提升稳定性和隐私保护 5. 主动收集用户反馈,关注竞品动态 |
| 开源资源 | 数据集、标注工具和结果开源:https://figshare.com/s/47c5ce42fd7e1dee69fe |
关键问题
-
用户主要讨论AI编码助手的哪些方面?
8大维度:功能性(如代码建议质量)、可用性(如界面设计)、可靠性(如是否崩溃)、系统性能(如资源消耗)、支持性(如兼容性)、整体体验(如 productivity)、价格、与其他工具的对比。 -
用户最喜欢AI编码助手的什么?
准确的代码建议、支持多编程语言、聊天界面便捷、响应速度快、免费使用。 -
用户最讨厌AI编码助手的什么?
建议冗余/不完整、上下文记忆差(“记不住之前说的”)、资源消耗高(占CPU/内存)、伦理问题(如“用开源代码训练却收费”)、插件崩溃或登录故障。 -
新手和资深开发者对AI助手的态度有区别吗?
有。14/15的新手觉得“很有帮助”,而2/5的资深开发者认为“没用,徒增烦恼”。 -
AI编码助手的发展趋势如何?
2023-2024年爆发式增长(90%的插件是这两年发布),但市场集中在头部插件(前10名占86%安装量)。
总结
本文通过挖掘VS Code Marketplace的真实用户评论,系统梳理了开发者对AI编码助手的态度:它们确实能提升效率,但在准确性、上下文理解、资源消耗等方面还有很多槽点。研究构建的分类体系和发现,为AI编码助手的优化提供了“用户视角”的指南——毕竟,工具好不好用,最终还是用户说了算。
更多推荐



所有评论(0)