
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
智谱AI发布轻量级OCR模型GLM-OCR,参数仅0.9B却实现SOTA性能。该模型在OmniDocBench V1.5评测中获94.6分,擅长处理手写体、复杂表格等场景,PDF处理速度达1.86页/秒,API成本低至0.2元/百万Tokens。采用"编码器-解码器"架构,支持图片/PDF输入,输出结构化文本/JSON/HTML。相比大模型更轻量专业,比传统OCR功能更全面。已

这篇文章探讨了如何构建高效的AI协作开发工作流,提出了"工程脚手架"的概念来解决当前AI助手在复杂项目中表现失控的问题。文章指出,真正的生产力提升不在于追求完美提示词,而是需要建立包含5大要素的系统化框架:工作目录、持久化规则、技能库、验证层和人工控制。作者详细介绍了最简目录结构设计,强调将记忆与规则外部化,并提供了核心控制流程和AGENTS.md模板作为"劳务合同"。针对不同开发场景(SaaS、

在科技圈,Naval Ravikant 的观点向来具有风向标意义。最近,他在播客中分享了一个令人振奋且略感不安的趋势:Vibe Coding(感官编码/感觉编程)

这篇文章详细介绍了如何利用 AI 工具(Claude Fable 5、Kimi Agent Swarm 和 ChatGPT)打造一个月入 1 万美元的独立应用工作室(App Studio)。其核心逻辑是放弃凭直觉开发大而全的应用,转而通过海量出货“功能单一、针对特定职业”的工具类应用,依靠 App Store 的自然搜索流量(ASO)实现变现。

本文梳理了AI大模型从2019年GPT-2到2026年KimiK3的技术演进历程,重点探讨了架构优化如何突破算力限制。七年间模型参数规模增长22,580倍,从1.24亿参数的GPT-2发展到2.8万亿参数的KimiK3。文章揭示了技术演进的核心挑战:在有限计算资源下优化信息处理效率,包括KV缓存机制、线性注意力(Linear Attention)等创新。通过分析GPT-2的基础架构、自回归解码的局

MiniMax 最新发布的 MiniMax M3 定位为“原生多模态、1M超长上下文、Agent 导向”的前沿大模型。针对算法工程、工业自动化以及大模型应用开发,其核心技术创新和亮点请参考本文

阿里开源首个统一科学语法多领域生成模型LOGOS,将生命科学、化学、材料等领域异构对象统一编码为离散Token序列,在纯自回归范式下实现多学科任务全面超越。该模型抛弃显式3D坐标和几何网络,通过"科学语法"将空间交互离散化,使1B参数模型在药物设计、逆合成预测、材料生成等任务上超越56B参数模型。LOGOS展现出惊人的参数效率,如药物设计任务中Vina Docking Score达-7.64,材料

本文对比了国产三大开源稀疏混合专家模型(MoE)——Kimi K3、DeepSeek V4 Pro和GLM-5.2。三款模型均支持100万Token的上下文窗口,但在性能、开源许可和成本上各有特点: Kimi K3(2.8T参数)综合性能最强(AI分析指数57分),但暂未开放权重; DeepSeek V4 Pro(1.6T参数)性价比最优(每美元115万Token),采用MIT许可; GLM-5.

黑森林实验室发布多模态基础模型FLUX 3,突破性地融合图像、视频、音频及动作预测能力。该模型基于Self-Flow技术,能生成20秒带原生音效的视频,支持文本/图像/视频互转,并在初期测试中超越多个竞品。FLUX 3还具备复杂图像生成和物理动作预测功能,已与Mimic Robotics合作开发机器人应用。实验室计划逐步开放视频API、动作预测模块和图像编辑功能,最终目标是构建感知-动作-语言完全

DeepSeek创始人梁文锋在投资人会议中阐述了公司聚焦AGI(通用人工智能)的战略路线,强调技术克制与长期愿景。他直言产品只是AGI路上的副产物,明确舍弃3D、视频生成等非核心方向,并主张开源与低成本策略以增强竞争力。梁文锋认为,AI的核心挑战在于实现持续学习能力,而非短期商业化,因此公司不追求成为超级App或争夺C端流量。他相信,保持团队稳定性、聚焦技术突破和开源生态将提升实现AGI的概率,并








