本文基于 Ubuntu 26.04 系统、纯CPU无CUDA硬件环境,完整演示基于 llama.cpp 实现 HF 原始模型转换 GGUF 格式与CPU量化的落地实操流程。以 Qwen2-0.5B-Instruct 中文对话模型为案例,循序渐进讲解Swap分区配置、系统依赖安装、llama.cpp源... ...
摘要 区别于仅能机械回应的标准旧版 AI,智能体式 AI 可以通过极具温度的对话式交互,精准捕捉到隐匿在旅客言语间的真实意图,进而匹配高度个性化的动态产品与随需应变的服务。由于将多源数据监控获取与高阶逻辑推理及自主行动力进行了深度融合,智能体式 AI 将业务流程从数周压缩至短短几分钟。这在大幅削减人 ...
4K+图像编辑新突破!针对数据匮乏与细节建模难题,我们发布首个指令式超高分辨率编辑数据集 VINS-120K(含12万精筛4K三元组)。同时提出高频感知适配策略,将预训练低分辨率模型轻松扩展至UHR领域,并配套评测基准 VINS-4KEval。显著提升编辑细节与纹理真实感! ...
用 WorkBuddy 通过对话做出一个纯前端 App 海报生成器,并复盘从第一版到开源发布的完整过程:设备比例、长截图定位、海报尺寸、水印和预览体验如何逐步改好。文中附在线 Demo 和 GitHub 源码。 ...
只会聊天的大模型价值有限,工具调用才是它从说到做的关键。本文拆解工具调用原理,结合WorkBuddy落地场景梳理五个关键点与边界。 ...
数据散在表格里、报表却迟迟出不来?本文拆解WorkBuddy如何用自然语言指令把取数、算指标、画图表串成一条链路,让业务同学也能自己出报表。 ...
awesome-dsh-plugin —— 一个由社区维护的 DeepSeek Harness 插件精选列表,收集所有符合官方协议、可以通过 dsh plugin add 命令安装的社区插件,并按品类进行分类整理,方便用户发现和使用。 ...
华东师范大学 ICALK 实验室联合上海人工智能实验室的工作 AutoMem,目前挂在 Arxiv 26.07 上,把 LLM Agent 的长期记忆设计重新表述成一个任务自适应的记忆架构搜索问题,本质上就是给每个 task 找一个现有方法的最佳组合 这篇工作可以看成是紧接着 MemEvolve 的 ...
MonkeyCode 是什么:一个浏览器里的 AI 开发平台 很多人第一次听说 MonkeyCode,会以为它又是一个"套壳 ChatGPT 的聊天窗口"。其实它不是聊天机器人,而是一套真正能干活儿的 AI 开发平台。 一句话介绍 MonkeyCode 是一个免费、无需安装的在线 AI 开发平台。你 ...
普通语言模型训练关注“下一段话像不像正确答案”,Agentic-RL 更关心模型在多步环境中能否选择合适动作、使用工具、处理反馈并完成目标。奖励来自整条轨迹,而不只是最后一句话。 先看几种训练方法各自解决什么 SFT 用高质量示范教会基本格式和行为;DPO 利用偏好对让模型倾向更好的回答;PPO 与 ...
LangChain 是目前大模型应用开发领域最主流、最成熟的开源框架之一,广泛应用于私有化部署、智能体开发、工具调用、流式交互等各类场景。本文基于 LangChain 最新稳定版接口,适配本地私有化 GGUF 模型部署环境,拆解框架四大核心基础能力,标准化消息机制、闭环工具调用链路、多场景流式传输、... ...
AI标书审查怎么防大模型幻觉?拆解证据溯源的4道工程防线:无出处不入库、轨迹锚定、逐字比对校验、状态代码派生,让每条审查结论都能定位回原文页码。 ...
工具解决的是“调用一次能力”,Skill 解决的是“复用一套完成任务的方法”。当 Agent 不只需要一个函数,而是需要步骤、资源、判断标准和验证方式时,技能系统就比不断扩充工具列表更合适。 Tool、Skill 和 Sub Agent 的边界 Tool 通常是原子动作,例如读文件、查订单;Skil ...
大模型在代码工程里能聊天却难干活,关键在于上下文管理、工具调用与结果校验。奇摩解析WorkBuddy如何让大模型真正落地。 ...
单次 Demo 能跑,不代表 Agent 可以交给真实用户。模型输出、工具调用、状态恢复、权限控制和人工介入之间,还需要一个稳定的运行外壳,这就是我理解的 Harness Engineering。 Harness 管的是整个运行环境 它通常包括明确的项目指令、上下文策略、工具契约、状态机、结构化输出 ...
用WorkBuddy把日报汇总、内容分发、系统巡检等重复任务自动化,三步上手,让团队把时间还给真正有价值的判断。 ...
微软开源Agent Lightning框架,用真实Harness做强化学习训练,6000条样本把Qwen3.5-9B的SWE-bench从41.8%拉到56.4%,追平GPT-5.5。 ...
一张二手RTX 3090跑通Meta Muse Glimmer 30B,llama.cpp+DFlash+Pi Agent三件套,127 tokens/s,本地Vibe Coding时代到来。 ...
上下文窗口是有限且昂贵的资源。Context Builder 要在每次模型调用前做一次认真取舍:什么必须带上,什么先摘要,什么此刻根本不该出现。 把上下文元素结构化 候选内容可以统一表示为 {kind, content, tokens, priority, source, expires_at, a ...
本文以通义千问Qwen量化GGUF模型为案例,基于Llama.cpp框架展示本地大模型调用与功能开发的完整实现原理及流程。全文采用原生Python编写代码案例,无需依赖重型AI框架,依次实现模型元数据解析、本地接口单次对话调用、多轮对话持久化记忆、自定义工具调用拓展等功能实现逻辑,针对直接调用大模型... ...