
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文为websocket系列文章的第一篇,主要讲解一些websocket的基本概念和使用方法。WebSocket 是一种网络通信协议,它允许在客户端和服务器之间建立一个持久的连接,使得数据可以实时、双向地传输,从而为需要快速、连续交互的应用如在线游戏、聊天应用和实时数据更新提供了一个高效、低延迟的通信解决方案。本文讲解的内容很简单,更多的是为了加深对websocket的理解所做的一些笔记。

很多人喜欢争论 RAG 和微调孰优孰劣,其实没必要。RAG 是“外脑”,微调是“内化”。真正的成熟系统,往往两者兼用——让模型既能查,又能懂。微调是为了“减少思考错误”;RAG是为了“增加事实正确”。当我们能平衡这两者时,AI 才算真正进入“能用”的阶段。

因为涉及到互翻,所以首先要告诉模型翻译的方向,具体就是在文本数据之前加一个目标语言的标识符,比如中翻英,原文“你好,你是谁?还有一个问题就是,输入是中英混合的文本,这样sentencepiece分词器也无法正确识别,一个办法就是将中英文分开,分别进行分词,然后将分词的结果按顺序进行拼接。通过下面的代码微调之后,就能得到一个双向的翻译能力的模型了,使用的方法和原生模型一样,直接加载就能推理了。最后,

场景决定选择,没有最好的工具,只有最合适的工具。个人玩票/快速验证:Ollama是你的不二之选。本地运行(无N卡/Mac):llama.cpp能给你带来惊喜。通用生产级API服务:vLLM是当前社区最主流、性能最强的选择之一。TGI如果你深度绑定Hugging Face生态,它会更顺手。复杂的生产级推理(Agent/CoT):SGLang能在提供顶级性能的同时,显著简化你的业务代码。追求极致性能的

这样 Ollama 会在后台持续运行,不会阻塞 Notebook。这种方式非常适合 本地开发、离线测试 或 低成本项目原型搭建。在开发中我们常使用 OpenAI 的 API,但当。一个简单且免费的解决办法是 ——时,程序会报错中断。

最近在折腾大模型的Function Calling(函数调用),也就是让大模型能联网、能查库、能执行代码。以前觉得这东西挺神秘,其实拆解开来看,核心逻辑并不复杂。正好手头有一段刚跑通的代码,本来是记在Jupyter里的,现在整理记录一下。这段代码用的是本地部署的Qwen3(通义千问)模型,配合OpenWeather的API查天气。下面就顺着代码逻辑,把这套“让大模型通过外部工具获取信息”的流程给捋

实际开发中,推荐使用 Pydantic 定义返回结构,再自动生成 JSON Schema。intent: Literal["查询天气", "播放音乐", "其他"]这样做有两个好处:第一,vLLM 可以使用 Schema 约束模型生成;第二,模型输出后还可以继续使用 Pydantic 做解析和校验。vLLM 的结构化输出解决了一个很实际的问题:让大模型输出从“给人看的文本”变成“可以直接被程序使用

↓远程 app-server↓没有继承 HTTP_PROXY↓网络异常最终通过给codex↓↓强制注入 HTTP_PROXY↓真正的 Codex binary↓OpenAI如果代理配置没了,重新生成 wrapper 即可。

这个命令是用来生成基于 Ed25519 算法的 SSH 密钥对(公钥 + 私钥),是 Git 等工具通过 SSH 协议免密码访问远程仓库(比如 GitHub/Gitee/GitLab)的核心操作。settings -> SSH and GPG keys -> New SSH key-> 粘贴生成的公钥 -> 起一个名字(如果是服务器就起用户名,比如tu) -> 添加。个人设置 -> SSH公钥 -

最近在折腾大模型的Function Calling(函数调用),也就是让大模型能联网、能查库、能执行代码。以前觉得这东西挺神秘,其实拆解开来看,核心逻辑并不复杂。正好手头有一段刚跑通的代码,本来是记在Jupyter里的,现在整理记录一下。这段代码用的是本地部署的Qwen3(通义千问)模型,配合OpenWeather的API查天气。下面就顺着代码逻辑,把这套“让大模型通过外部工具获取信息”的流程给捋








