1085个AI编码插件+361条真实评论:用户到底在抱怨什么?

论文信息

  • 原标题:“My productivity is boosted, but …” Demystifying Users’ Perception on AI Coding Assistants
  • 主要作者及机构
    • Yunbo Lyu、Jieke Shi、Yue Liu、David Lo(新加坡管理大学)
    • Zhou Yang(阿尔伯塔大学)
    • Jianming Chang(东南大学)
  • 引文格式(APA):Lyu, Y., Yang, Z., Shi, J., Chang, J., Liu, Y., & Lo, D. (2025). “My productivity is boosted, but …” Demystifying users’ perception on AI coding assistants. arXiv preprint arXiv:2508.12285v1.
  • 发布时间:2025年8月17日

一段话总结

本文通过分析VS Code Marketplace中1085个AI编码助手插件的5908条用户评论(抽样361条),构建了包含8大类别、16个子类和62个标签的用户反馈分类体系,揭示了开发者对AI编码助手的真实态度:既认可其提升效率的价值,也吐槽建议冗余、上下文理解差、资源消耗高等问题,并据此提出了5项改进建议,为AI编码助手的优化提供了接地气的方向。

思维导图

在这里插入图片描述

研究背景

AI编码助手(如GitHub Copilot)已经成为很多开发者的“搭档”,它们能自动补全代码、修复bug、生成测试用例,号称能“加速开发”。但实际使用中,开发者可能花一半时间验证AI的建议——比如AI生成的代码看似正确,却隐藏着逻辑漏洞;或者频繁弹出不相关的提示,反而打乱思路。

过去的研究要么是在实验室里让开发者模拟 coding(环境不真实),要么只盯着 GitHub Copilot 一个工具(视角太窄),要么只收集技术大佬在GitHub Issues里的吐槽(忽略了新手和普通用户)。就像想了解一款手机好不好用,只问了数码博主,却没听普通消费者的声音——这显然不够全面。

而VS Code作为全球74%开发者在用的IDE,其插件市场里有大量AI编码助手,用户评论直接来自日常工作场景,堪称“开发者真实心声数据库”。这篇论文就盯上了这个数据库,想搞清楚:开发者到底觉得这些AI助手哪里好、哪里糟?

创新点

  1. 数据来源接地气:首次大规模分析VS Code Marketplace的真实用户评论,覆盖1085个AI插件,包含新手、非技术用户等“被忽略的声音”。
  2. 分类体系更全面:不仅关注技术问题(如bug),还包含用户体验(如界面设计)、价格、伦理等之前被忽视的维度(比如“用开源代码训练却收费”的争议)。
  3. 对比视角独特:横向对比32个不同AI助手的用户反馈,而不是只盯着单个工具(如GitHub Copilot)。

研究方法和思路

步骤1:筛选AI编码助手

  • 从VS Code Marketplace的66053个插件中,用4种方法找AI相关插件:
    • 官方搜索“AI”关键词
    • 筛选“AI”“Chat”“Machine Learning”分类
    • 匹配“ai”“gpt”“copilot”等标签
    • 扫描插件描述中的55个AI相关关键词(如“large language model”)
  • 用人工+GPT-4o验证(精度和召回率超96%),最终确定1085个AI插件。

步骤2:选择分析样本

  • 挑出32个“有代表性”的插件:要么安装量高(前30名,占总安装量95.3%),要么评论多(超100条)。
  • 从5908条评论中排除太短(<10字)的,随机抽361条(满足95%置信度+5%误差),翻译非英文评论。

步骤3:构建分类体系

  • 4位研究者手动标注评论,用“自下而上”的方式合并标签:
    • 先给每条评论贴标签(如“建议准确”“内存消耗高”)
    • 合并相似标签,形成62个叶子节点
    • 再归类到16个子类、8个大类(如“功能性”“可用性”“价格”)。

步骤4:情感分析

  • 给每个标签标注“喜欢”“讨厌”“中性”(如“建议准确”是喜欢,“冗余输出”是讨厌),最终计算各维度的情感倾向。
    在这里插入图片描述

主要贡献

贡献类型 具体内容
数据层面 识别出VS Code中1085个AI编码助手,发现90%是2023-2024年发布(爆发式增长),且头部10个插件占86%安装量(垄断明显)。
理论层面 构建8大类、16子类、62标签的用户反馈分类体系,覆盖功能、体验、价格等维度(可直接用于其他AI工具的用户研究)。
发现层面 6项关键发现:
1. 新手更认可AI助手,资深开发者更挑剔
2. 建议准确性最受重视,但冗余/不完整是常见槽点
3. 上下文理解差(如“记不住之前的对话”)是大痛点
4. 复杂的入门流程会让用户放弃
5. 资源消耗高(CPU/内存)但响应速度可接受
6. 免费工具更受欢迎,伦理问题(如“用开源数据赚钱”)影响 adoption
实践层面 5项改进建议:
1. 优化上下文感知(如代码库索引)
2. 加强聊天/代理界面的交互设计
3. 简化入门流程,减少资源消耗
4. 提升稳定性和隐私保护
5. 主动收集用户反馈,关注竞品动态
开源资源 数据集、标注工具和结果开源:https://figshare.com/s/47c5ce42fd7e1dee69fe

关键问题

  1. 用户主要讨论AI编码助手的哪些方面?
    8大维度:功能性(如代码建议质量)、可用性(如界面设计)、可靠性(如是否崩溃)、系统性能(如资源消耗)、支持性(如兼容性)、整体体验(如 productivity)、价格、与其他工具的对比。

  2. 用户最喜欢AI编码助手的什么?
    准确的代码建议、支持多编程语言、聊天界面便捷、响应速度快、免费使用。

  3. 用户最讨厌AI编码助手的什么?
    建议冗余/不完整、上下文记忆差(“记不住之前说的”)、资源消耗高(占CPU/内存)、伦理问题(如“用开源代码训练却收费”)、插件崩溃或登录故障。

  4. 新手和资深开发者对AI助手的态度有区别吗?
    有。14/15的新手觉得“很有帮助”,而2/5的资深开发者认为“没用,徒增烦恼”。

  5. AI编码助手的发展趋势如何?
    2023-2024年爆发式增长(90%的插件是这两年发布),但市场集中在头部插件(前10名占86%安装量)。

总结

本文通过挖掘VS Code Marketplace的真实用户评论,系统梳理了开发者对AI编码助手的态度:它们确实能提升效率,但在准确性、上下文理解、资源消耗等方面还有很多槽点。研究构建的分类体系和发现,为AI编码助手的优化提供了“用户视角”的指南——毕竟,工具好不好用,最终还是用户说了算。

更多推荐