核心用法
Samvida 是一款专门为企业网站生成 llms.txt 文件的专业工具。llms.txt 是新兴的开放标准,旨在让 AI 代理能够结构化地读取、理解和与企业进行交易。该技能通过以下步骤完成工作:
1. 网站爬取:自动爬取目标网站,提取关键信息(团队、定价、客户评价、API 文档等)
2. 信息补全:针对爬取缺失的内容,通过对话式交互向用户询问
3. 智能生成:根据 llmstxt.org 规范生成标准化的 llms.txt 文件
4. 深度模式:支持 "dig deeper" 指令,对原始页面内容进行更深层次的解析
显著优点
- 标准化输出:严格遵循 llmstxt.org 规范,确保生成的文件能被各类 AI 代理正确解析
- 业务感知扩展:针对企业场景增加了 Team、Clients & Testimonials、For Agents 等特色章节
- 渐进式信息收集:采用对话式、单问题逐步推进的方式,避免一次性表单的压迫感
- 深度爬取能力:支持
--deep模式,可从原始 HTML 文本中提取结构化信息 - 现有文件检测:自动检测网站是否已有
llms.txt,提供对比和更新建议
潜在缺点与局限性
- 依赖外部爬虫:核心功能依赖本地 Python 爬虫脚本,环境配置要求较高(指定 virtualenv 路径)
- 非实时部署:Phase 2 才支持 Cloudflare Workers 自动部署,当前版本需手动复制文件
- 信息真实性约束:明确禁止编造客户评价或业务数据,可能导致部分章节内容稀疏
- 英文生态为主:
llms.txt标准源自英文社区,对中文企业网站的适配性未明确说明
适合人群
- 希望让自家网站被 AI 代理(如 Claude、ChatGPT、Perplexity 等)理解和引用的企业
- 拥有 API 或自动化服务能力,希望降低 AI 系统集成门槛的技术公司
- 需要标准化机器可读业务信息的 SaaS、B2B 服务提供商
常规风险
- 信息暴露风险:生成的文件包含团队邮箱、定价策略、API 端点等敏感信息,需人工审核后再发布
- 爬虫合规性:自动爬取可能触发目标网站的反爬机制,需确保使用场景合法
- 标准演进风险:
llms.txt标准仍在发展中,未来格式变更可能需要重新生成 - SEO 影响:目前不明确搜索引擎如何处理
llms.txt文件,建议与robots.txt配合使用