论文汇总
整理网站发布过的论文调研,涉及多模态、模型训练、目标分类、目标检测、目标分割、图像检索、OCR、人脸检测/识别、模型蒸馏、模型剪枝、视频识别、细粒度分类、行人属性识别、视频压缩等领域。
整理网站发布过的论文调研,涉及多模态、模型训练、目标分类、目标检测、目标分割、图像检索、OCR、人脸检测/识别、模型蒸馏、模型剪枝、视频识别、细粒度分类、行人属性识别、视频压缩等领域。
距离上一次搭建Hexo/NexT博客网站已过去四年。虽然整体交互体验并未发生颠覆性的变化,但在交互细节与部署实现方面,确实持续进行了打磨与优化。这一次我打算使用最新版本(hexo 8.1.1 / NexT 8.26.0)重新构建我的博客网站,同时会结合更多的工具(Docker、Github Action/Pages、Gitea Actions/Nginx)来优化整个部署PIPELINE。
Claude Code 的 skill 机制将工作流知识按需注入上下文,解决了 CLAUDE.md 全量加载与低频流程常驻的矛盾。本文以 claude-skills 仓库(maestro 与 dataflow 两个插件)为案例,介绍 skill 从项目内工作流到 marketplace 分发的完整实践:机制基础、skill 分类、插件化设计、hook 注入、版本管理、评估驱动迭代与踩坑记录。
SDD 的约束模型存在结构性缺陷:spec 是静态文档,约束依赖 Agent 主动阅读并自行对照,执行阶段仍会出现遗漏。本文介绍 DataFlow-CV 从 SDD 到 Skills 的优化实践:spec 维护方法论固化、开发 skill 抽取与 CLAUDE.md 结构优化、PreToolUse hook 主动约束注入,以及插件化分发与工程解耦。
大模型并不直接「读」文本,也不直接「看」图片——所有输入都要先被翻译成模型唯一认识的数学对象:Token(词元)。本文从两种最基本的输入形式出发,讲清楚文本和图片是如何一步步变成 Token 序列的。
单 Prompt 有承载上限——复杂任务需要拆解,让多个 Prompt、甚至多个模型协同工作。本文讨论三种编排模式:Prompt Chaining(链式分解)、路由策略(小模型分类 + 大模型推理)、以及 Tool-use / Agent 协作。重点不在代码实现,而在每种模式下 Prompt 的设计思路。
RAG 解决的是 LLM 的知识边界问题——把外部知识检索出来,注入到 prompt 里让模型去理解和回答。但注入的上下文如何组织、如何让模型区分检索到的知识和自身知识、如何要求模型引用来源——这些都是 prompt 设计问题。本文聚焦 RAG 场景下的提示词设计策略。
Prompt Engineering 的核心是对齐——让大模型对需求的理解与预期一致。本文覆盖单提示词优化的四个维度:需求明确化、思维链推理引导、Few-shot 示例约束、结构化输出设计。
Version: v1.0 | Last Updated: 2026-06-27
本文档定义 SDD(规约驱动开发,Spec-Driven Development)的通用方法论。
目标读者:AI Agent(如 Claude Code)和人类开发者。
本文档可直接拷贝到任何采用 SDD 方法论的新工程中使用。
Claude Code + DeepSeek V4.0 … YYDS !!!
从 Vibe Coding 到 SDD:上下文天花板、熵增陷阱、被动重写——三个痛点指向同一个问题:缺少可复用的、模型能直接消费的「真理来源」。本文记录 DataFlow-CV 的 SDD 落地实践:三层 spec 体系、五步开发工作流、两个典型案例,以及下一步从 SDD 到 Rules/Skills 的升级路径。