logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

线上 Go 集群每隔 1 小时抖动卡顿?竟是 cgroup CPU quota 踩限了

必须引入:所有容器化 Go 项目必须在main.go中匿名导入。警惕 cgroup CFS Quota:容器使用率看起来不高,但并发线程过多会迅速打满 100ms 窗口配额引发 Throttle。监控指标:将容器 CPU Throttle 比例暴露给 Prometheus,大于 5% 即代表配置存在严重冲突。合理设置 CFS Period:在 K8s API 中对极高并发服务设置为 20ms 以降

#人工智能
大模型对话界面实战:流式输出与 Markdown 渲染的工程落地

流式渲染的工程要点其实就三件事:数据链路用流式读取,不要轮询。渲染必须配合消毒库,模型不可信。生命周期交给管理,别让陈年流占着连接。剩下的就是看监控——首字延迟、解析耗时、并发流数。指标上去了,体感才上得去。这条路在千万级对话下能跑通,回报是值得的。

#人工智能
让大模型画出图表:自然语言转 ECharts 配置的前端落地链路

NL2Chart 落地的核心,不在"调用模型",而在"消化模型产物"。前端必须建立结构校验、默认补全、沙箱执行与超时保护四道防线,把不可信的模型输出转化为稳定可渲染的配置。安全上应坚持配置优先、禁止直接执行代码,必要时借助 Web Worker 隔离。工程上可用骨架兜底加异步精确的平衡策略兼顾速度与准确率。对于自助式分析场景,NL2Chart 能降低图表制作门槛;对视觉约束强的品牌页则仍需人工把关

#人工智能
端侧大模型推理:WebGPU 与 Transformers.js 的浏览器落地实践

端侧大模型推理把算力下沉到浏览器,主要价值在于隐私可控与零推理账单。落地关键有三:一是基于 WebGPU 探测做分级回退,保证异构设备都有可用路径。二是把模型加载与推理放入 Worker,用单例与量化权重控制体积,用kv_cache优化多轮延迟。三是用进度反馈与 Cache Storage 预取改善冷启动。权衡上需直面兼容性碎片、量化精度损失与首次加载成本。对于隐私敏感、离线、短文本场景,端侧推理

#人工智能
流式 Markdown 的增量渲染:让大模型回答边生成边排版

流式 Markdown 渲染的目标,是让大模型回答在生成过程中就拥有正确排版,而非生成结束再整体美化。落地要点有三:第一,把解析改为有状态增量消费,用"已闭合块缓存 + 当前块重渲染"把重解析范围压到最小;第二,代码围栏等语法块必须检测闭合状态,未完成前只累积不高亮,避免半成品闪烁;第三,用帧节流合并高频 chunk、用生命周期销毁防止竞态写入。在资源受限时,应优先复用成熟的流式 Markdown

#人工智能
大模型端侧推理的前端落地:WebGPU 与 ONNX Runtime 的浏览器部署

端侧大模型推理用 WebGPU 与 ONNX Runtime 把部分 AI 能力下沉到浏览器,换取低延迟、低成本与数据不出端。落地要点有三:第一,仅对小规模、低延迟、高隐私要求的任务端侧化,大模型仍留云端;第二,生产封装必须包含模型缓存、WebGPU→WASM 降级、推理超时三道保险,把可用性放在性能前面;第三,警惕设备差异、模型版本滞留、电量发热与权重泄露四道边界,越界场景应回退云端。端云协同、

#人工智能
用大模型生成图表配置:自然语言到可视化代码的落地架构

用大模型生成图表配置,本质是把「可视化配置语言」这层翻译工作交给 LLM,让人用业务语言直接要图。落地要点有三:第一,必须用 schema 约束与 JSON mode 把模型输出锁死在受支持范围,杜绝自由格式;第二,字段白名单对齐与沙箱渲染兜底缺一不可,确保任何畸形输出都只降级而非崩溃;第三,认清边界,敏感数据需脱敏、复杂图走模板、确定性场景要缓存、高频请求分层拦截、输出须防 XSS。把大模型当作

#人工智能
浏览器跑大模型:WebGPU 端侧推理的加载、回退与性能工程

端侧推理把大模型能力延伸到浏览器本地,主要价值在降低延迟、摊薄成本与保护隐私。落地建议:第一,建立分级后端探测,WebGPU 优先、WASM 回退、云端兜底,保证任意设备可用。第二,模型权重必须懒加载并单例缓存,设置超时与中断控制。第三,把重计算放入 Worker,避免阻塞主线程交互。第四,明确适用边界,仅在轻量、离线、隐私场景启用端侧,强推理任务仍走云端。最终在体验、成本与设备约束之间取得工程平

#人工智能
让大模型画图表:自然语言转可视化配置的前端落地与校验

NL2Chart 把自然语言变成可交互图表,是 AI 前端的重要落地方向。落地建议:第一,用白名单与 Schema 对齐约束模型输出,阻断字段幻觉。第二,所有生成必须超时、可中断,失败统一降级为表格。第三,控制提示词体积,宽表场景只传字段结构。第四,高频意图缓存模板,保证体验一致性。最终在智能生成与稳定可控之间取得平衡。这条路在生产看板下能跑通,回报是值得的。

#人工智能
大模型流式对话界面:从 SSE 接收到逐字渲染的前端架构

流式对话界面的核心,是把网络协议、缓冲解码、渲染调度三层职责解耦。优先选 SSE 降低接入成本,用的流式模式解决中文跨片乱码,用统一中断来源。渲染侧借助批量合并,并对超长内容做降级。落地时务必补齐超时、重试与安全校验。这条路在千万级对话下能跑通,回报是值得的。

#人工智能
    共 20 条
  • 1
  • 2
  • 请选择