
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
ubuntu配置n卡驱动使得ollama运行在显存上
使用journalctl -u ollama -f命令,经常能看到请求时长在40多秒,而且是长时间不使用模型之后,第一个请求总是40多秒,第二个请求就能保持在7秒左右,用户体验尚可。Ollama 发现 HTTP 连接断了,触发 context canceled,强行中断底层的推理引擎(llama runner)。Nginx 等得不耐烦了,到达 60 秒阈值,直接强行切断了和 Ollama 的连接(
macos 使用proxyman抓包claude code
在terminal里设置export代理,将本终端的流量都代理到该ip。打开proxyman,找到监听的ip和端口号,默认监听9090。
到底了







