rag 标签归档

共 14 篇文章 · 返回首页

【开源许可与版权工程】AI 训练数据的版权:从 Books3、Common Crawl 到生成式模型侵权

一篇话讲清楚:网络爬取训练语料、书籍/代码/图片数据集、合成数据与 RAG 私域数据在著作权法上的真实边界。覆盖美国 fair use、欧盟 TDM 例外、日本 30-4 条、中国合理使用与生成式 AI 司法态度;逐个拆解 Books3、Common Crawl、LAION-5B、The Pile、StarCoder、Stack Exchange 等高频数据集的许可现状;给出工程团队在预训练、微调、RAG 三个场景下的可执行检查清单。

【系统架构设计】架构即 AI 上下文:让 AI 读懂你的系统

聊天窗口里的临时粘贴不是架构。本文分析上下文失败模式,给出 ADR、C4、OpenAPI 与运行时拓扑等可版本化工件如何成为 Agent 的权威上下文,讨论新鲜度与单一真相源,并划定与 RAG/向量引擎的分工及「文档即上下文」是否制造新单点的争论。

【系统架构设计】AI 原生架构:LLM 时代的系统设计

当 LLM 从离线批处理变成在线运行时组件,超时预算、按 token 计费、非确定性输出与多轮 Agent 编排必须进入架构的一等公民。本文从依赖语义差异出发,衔接弹性与过载保护,讨论网关成本治理、结构化输出与人审闸门、checkpoint 恢复与隐私友好的可观测,并划定与 RAG、向量引擎及训练基础设施的分工边界。