AI小白进阶指南:除了Codex,还有哪些好用的AI工具?
·
引言
1. 文本生成与对话AI
这类AI擅长理解和生成自然语言,可用于聊天、写作、翻译、总结等。
1.1 OpenAI GPT系列
- ChatGPT: 最出圈的对话AI,基于GPT-3.5/4等模型。界面友好,适合日常问答、头脑风暴、草拟文案。
- GPT-4: OpenAI最先进的模型,在推理、创意写作和复杂指令遵循方面表现突出,通常通过ChatGPT Plus或API使用。
1.2 Claude (Anthropic)
- 由Anthropic开发,以“ Constitutional AI ”理念构建,注重安全性和无害性。Claude在长文本处理、文档分析和逻辑推理方面口碑很好,上下文窗口极大(可达20万token)。
1.3 国内大模型
- 文心一言 (ERNIE Bot): 百度推出的对话式AI,中文理解能力强,集成百度搜索知识。
- 通义千问: 阿里云的大模型,在阿里生态内集成度高。
- 智谱清言 (GLM): 基于清华智谱的GLM系列模型,在代码和数学推理上有不错表现。
- Kimi Chat: 月之暗面出品,以超长上下文(可达百万字)和优秀的文件处理能力著称,适合阅读长文档、整理资料。
2. 代码生成与辅助AI
专为开发者设计,能理解代码上下文,生成、解释、调试代码片段。
2.1 GitHub Copilot
- 虽然底层是Codex,但作为产品,它是目前最成熟的AI编程助手,深度集成在VS Code等IDE中,支持多种语言。
2.2 其他代码AI
- Amazon CodeWhisperer: AWS推出的免费代码助手,对AWS服务支持好。
- Tabnine: 老牌代码补全工具,也集成了AI能力,支持本地模型部署,注重隐私。
- Cursor: 一款集成了强大AI(基于GPT)的编辑器,主打“与AI结对编程”体验,能通过对话直接修改代码。
- 通义灵码 (Alibaba Cloud): 阿里云推出的智能编码助手,对中文开发者友好。
3. 图像生成AI
输入文字描述(Prompt),AI生成图片。
3.1 Midjourney
- 在艺术性、构图和美学方面公认的顶级选手,尤其擅长概念艺术、插画风格。通过Discord使用。
3.2 DALL·E 3 (OpenAI)
- 集成在ChatGPT中,使用非常方便。对文字的理解和还原能力极强,能精确生成包含特定文本的图片。
3.3 Stable Diffusion
- 开源模型,生态极其丰富。可以在本地运行(需要显卡),有大量社区模型(Checkpoint)、插件(如ControlNet)可供选择,可控性最强,适合喜欢钻研的玩家。
3.4 国内图像生成
- 文心一格 (百度): 中文Prompt友好,风格多样。
- 通义万相 (阿里): 提供多种风格的图像生成。
4. 多模态与视频AI
能同时处理和理解文本、图像、音频、视频等多种信息。
4.1 GPT-4V (Vision)
- GPT-4的视觉版本,可以“看懂”图片并回答相关问题,用于图像分析、描述、基于图片的推理。
4.2 Gemini (Google)
- Google的旗舰多模态模型,从设计之初就原生支持文本、图像、音频、视频等多种输入,在多项基准测试中表现优异。
4.3 Sora (OpenAI) & 其他视频生成
- Sora: 能根据文本生成长达一分钟的高质量、高一致性视频,代表了当前视频生成的最高水平(尚未公开)。
- Runway ML / Pika Labs: 目前可用的热门AI视频生成工具,能实现文生视频、图生视频、视频风格化等。
5. 如何选择?给AI小白的建议
- 明确需求: 你是想聊天、写文章、学编程、画图,还是处理视频?先确定主要用途。
- 从易用性入手: 优先选择有友好网页版或成熟客户端的工具,如 ChatGPT、文心一言、Midjourney(Discord)。
- 关注成本: 许多AI有免费额度或基础免费版(如 ChatGPT 3.5, Claude Sonnet),高级功能或更高限额需要付费。
- 尝试与比较: 对同一任务(如“写一封邮件”),用不同AI试试,感受它们风格和能力的差异。
- 学习Prompt技巧: AI的输出质量很大程度上取决于你的输入指令。学习一些基本的Prompt工程技巧能大幅提升效果。
实战示例:好Prompt与普通Prompt对比
理解了Prompt技巧的重要性后,我们通过两个具体场景来看看优质Prompt和普通Prompt的区别:
场景一:文本创作(使用ChatGPT/文心一言等对话AI)
- 任务:写一篇关于春天的短文。
- 普通Prompt:
写一篇关于春天的文章。 - 优质Prompt:
请以一位城市上班族的视角,写一篇300字左右的散文,描述某个周末清晨在公园感受到的春天。要求:1. 包含视觉(如新芽、花朵)、听觉(如鸟鸣)、嗅觉(如泥土和花香)的细节描写;2. 融入一丝对时光流逝的淡淡感慨;3. 语言优美、略带诗意,但避免过于矫情。 - 好在哪里:优质Prompt明确了角色(城市上班族)、场景(周末清晨公园)、具体感官细节、情感基调(淡淡感慨)和风格要求(优美略带诗意)。这能引导AI生成更具画面感、情感层次和文学性的内容,而非泛泛而谈的“春天很美”。场景二:代码生成(使用GitHub Copilot/Cursor等代码AI)
- 任务:生成一个登录页面的前端代码。
- 普通Prompt:在HTML文件中输入
<!-- 登录页面 --> - 优质Prompt:
<!-- 请生成一个现代风格的登录页面,包含以下元素: 1. 一个居中的卡片容器,有轻微阴影和圆角。 2. 标题“欢迎回来”,副标题“请登录您的账户”。 3. 用户名和密码输入框,带占位符和图标。 4. “记住我”复选框和“忘记密码?”链接。 5. 一个居中的提交按钮,背景为渐变色。 6. 底部有“还没有账号?立即注册”的链接。 要求:使用Flexbox布局,配色以蓝色为主色调,代码需包含必要的CSS样式。 --> - 好在哪里:优质Prompt通过注释清晰地定义了功能需求(所有表单元素)、样式要求(现代风格、卡片、阴影、圆角、布局、配色)和结构说明。这能让代码AI理解上下文和设计意图,生成更完整、可直接使用或微调的前端代码,而不是零散的片段。
场景三:图像生成(使用Midjourney/Stable Diffusion等图像AI)
- 任务:生成一张“猫”的图片。
- 普通Prompt:
一只猫。 - 优质Prompt:
一只毛茸茸的橘色英国短毛猫,正蜷缩在铺着柔软针织毯的窗台上晒太阳。午后温暖的阳光透过百叶窗,在它身上投下斑驳的光影。画面采用柔和的光线,温馨的室内场景,风格为细腻的写实摄影,焦点在猫的眼睛,背景略微虚化,整体色调温暖、宁静。 --ar 16:9 --style raw --v 6.0 - 好在哪里:优质Prompt详细指定了主体特征(品种、颜色、动作)、环境与构图(窗台、毯子、阳光、光影)、视觉风格(写实摄影、光线、色调、焦点)以及技术参数(宽高比、风格版本)。这能引导图像AI生成一张具有故事感、艺术性和技术细节的高质量图片,而不是一个简单、模糊的猫的剪影。场景四:多模态分析(使用GPT-4V/Gemini等多模态AI)
- 任务:分析一张图表并总结趋势。
- 普通Prompt:
分析这张图表。 - 优质Prompt:
请分析我上传的这张“2023-2024年季度销售额与用户增长趋势图”。请完成以下任务:1. 识别图表类型(如折线图、柱状图)和坐标轴含义。2. 分别描述销售额和用户数量在每个季度的变化趋势。3. 指出两个指标之间是否存在明显的相关性(例如,用户增长是否带动了销售额提升)。4. 基于数据,提出一个可能的原因假设。请用分点列表的形式回答,语言简洁专业。 - 好在哪里:优质Prompt明确了分析对象(图表标题)、具体分析步骤(识别、描述、关联、假设)、输出格式要求(分点列表)和语言风格(简洁专业)。这能引导多模态AI进行结构化、深入的视觉内容分析,并提供有洞察力的结论,而不是仅仅复述图表中的可见信息。## 主流AI工具速览表
| 工具名称 | 核心模型/技术 | 主要功能 | 特点与优势 | 适用人群 | 成本/获取方式 |
|---|---|---|---|---|---|
| 文本生成与对话AI | |||||
| ChatGPT | GPT-3.5/4 | 对话、问答、写作、翻译、总结、头脑风暴。 | 界面友好,生态成熟,插件丰富,适合日常使用。 | 普通用户、学生、内容创作者、需要快速获取信息的任何人。 | 免费版(GPT-3.5),ChatGPT Plus订阅(约20美元/月)或API付费。 |
| Claude | Claude (Anthropic) | 长文本处理、文档分析、逻辑推理、安全对话。 | 上下文窗口极大(可达20万token),注重安全性和无害性,逻辑性强。 | 需要处理长文档的研究者、分析师、法律或合规相关工作者。 | 有免费版(Claude Sonnet),高级版需订阅或API付费。 |
| 文心一言 | ERNIE Bot | 中文对话、写作、搜索增强、知识问答。 | 中文理解能力强,集成百度搜索知识,对国内用户友好。 | 中文用户、需要结合搜索信息的用户、百度生态用户。 | 目前免费。 |
| Kimi Chat | 月之暗面大模型 | 超长上下文对话、文件上传与处理、资料整理。 | 支持百万字上下文,优秀的文件处理能力,适合阅读和分析长文档。 | 学生、研究者、需要处理大量文档的分析师。 | 目前免费。 |
| 代码生成与辅助AI | |||||
| GitHub Copilot | Codex (GPT系列) | 代码补全、函数生成、注释生成、代码解释。 | 最成熟的AI编程助手,深度集成主流IDE,支持多种语言。 | 希望提升编码效率的开发者、编程学习者。 | 免费版有限额,专业版需订阅(约10美元/月)。 |
| Cursor | GPT系列 | 智能代码编辑、对话式编程、代码重构、错误修复。 | 主打“与AI结对编程”体验,能通过对话直接理解和修改代码。 | 希望与AI深度协作的开发者、探索新编程范式的用户。 | 免费版有限额,专业版需订阅。 |
| Amazon CodeWhisperer | Amazon自有模型 | 代码补全、安全扫描、AWS服务最佳实践推荐。 | 对AWS服务支持好,免费,注重代码安全。 | AWS开发者、云原生应用开发者。 | 目前免费。 |
| 通义灵码 | 通义千问代码模型 | 代码补全、注释生成、智能问答、代码优化。 | 对中文开发者友好,深度集成阿里云开发工具。 | 国内开发者、阿里云生态用户。 | 目前免费。 |
| 图像生成AI | |||||
| Midjourney | 专有模型 | 艺术图像、概念设计、插画创作。 | 艺术性与构图顶级,风格化效果出众,社区活跃。 | 艺术家、设计师、创意工作者、对美感要求高的用户。 | 通过Discord使用,需订阅(基础版约10美元/月)。 |
| DALL·E 3 | DALL·E 3 | 文生图、创意插图、包含文字的图像。 | 集成在ChatGPT中易用,对文字理解与还原精准。 | 普通用户、内容创作者、需要快速生成配图者。 | 需ChatGPT Plus订阅或API付费。 |
| Stable Diffusion | 开源模型 | 图像生成与编辑、风格迁移、可控创作。 | 开源免费,生态丰富,可本地部署,可控性极强,插件多。 | 技术爱好者、开发者、喜欢自定义的创作者、隐私敏感用户。 | 可免费本地运行(需显卡),在线服务(如DreamStudio)按次收费。 |
| 多模态与视频AI | |||||
| GPT-4V | GPT-4 with Vision | 图像理解、描述、分析、基于图像的推理。 | 强大的视觉理解能力,与ChatGPT无缝集成。 | 需要图像分析的内容审核、教育、研究等场景。 | 需ChatGPT Plus或API付费。 |
| Gemini | Gemini Pro/Ultra | 多模态对话、文档理解、跨模态推理。 | 原生多模态设计,支持文本、图像、音频、视频输入,基准测试领先。 | 开发者、研究者、需要多模态交互的应用构建者。 | 有免费额度,高级模型API付费。 |
| Sora | Sora (扩散模型) | 文生视频、生成高质量动态场景。 | 视频生成质量与一致性代表当前最高水平(未公开)。 | 视频创作者、研究者、关注前沿技术的爱好者。 | 尚未公开。 |
| Runway ML | 多种视频模型 | 文生视频、图生视频、视频编辑、风格化。 | 功能全面,创意工具丰富,社区资源多。 | 视频创作者、设计师、艺术工作者。 | 免费版有限,高级功能需订阅。 |
6. 延伸学习资源
- Learn Prompting:一个免费的、系统的Prompt工程教程网站,从基础到进阶,适合所有水平的学习者。
- AI Explained:YouTube上高质量AI工具评测与趋势解读频道,深入浅出,适合跟踪AI前沿动态。
- r/ArtificialIntelligence:Reddit上最活跃的AI技术讨论社区,汇集了全球开发者和爱好者,是提问和获取一手资讯的好地方。
7. 结语
AI工具正在飞速迭代,今天的"小白"可能很快成为明天的"高手"。除了本文提到的,还有无数垂直领域的AI(如音乐生成、PPT制作、法律咨询等)。最好的学习方式就是保持好奇,亲自上手体验。从解决一个实际的小问题开始,你会发现AI能成为你学习和工作中强大的助力。
更多推荐



所有评论(0)