领域缩略语展开 Skill:按内置或外部词典将独立缩略语替换为全称,可选在全称后保留原缩写。 适用于技术文本、论文摘要和业务记录中的缩写清洗;不负责模糊缩写消歧或大小写无关替换。
日本語の概要は準備中です。原文の説明を表示しています。
内容解析预处理工具。读取采集后的 JSONL、JSON 或 TXT 文本记录,执行轻量内容解析,输出带标题、段落结构和内容类型的统一解析记录文件。 当用户提到接入内容解析、采集后预处理、提取标题和段落、识别 plain/markdown/html 内容结构等需求时使用此 skill。 即使用户没有明确说出"内容解析",只要任务涉及把已采集文本内容解析成统一结构,就应该使用此 skill。 不负责文件采集、表格抽取、内容清洗、质量校验、过滤筛选或格式转换。
インストール方法を見るインストールする前に、エージェントに与えられる指示の中身を確認できます。
本 skill 用于读取采集后的文本记录,对 text 字段做轻量内容解析,识别 plain、markdown、html 内容类型,并输出标题、段落结构、字符数、词数等解析结果。
当用户请求以下任务时,应使用此 skill:
不适用于文件采集、表格抽取、内容清洗、质量校验、过滤筛选或格式转换;这些任务需要使用对应的采集、清洗、校验、过滤或转换 skill。
| 参数 | 说明 |
|---|---|
--input | 输入文件路径,支持 jsonl/json/txt |
--output | 输出文件路径 |
| 参数 | 说明 | 默认值 |
|---|---|---|
--parse_mode | 解析模式,支持 auto、plain、markdown、html | auto |
--extract_title | 是否提取标题 | True |
--extract_paragraphs | 是否提取段落列表 | True |
--output_format | 输出格式,支持 jsonl、json、auto | jsonl |
输入可以是 JSONL、JSON 或 TXT 文件。JSONL/JSON 中每条记录应包含 text 字段;TXT 文件会整体作为一条文本记录处理。
{"text": "# Research Note\n\nFirst paragraph..."}
{"text": "<html><title>Report</title><p>HTML paragraph.</p></html>"}
python scripts/run_content_parser.py \
--input ./content_records.jsonl \
--output ./content_parser_output.jsonl \
--parse_mode auto \
--extract_title true \
--extract_paragraphs true \
--output_format jsonl
python scripts/run_content_parser.py \
--input ./note.txt \
--output ./content_parser_output.json \
--parse_mode plain \
--output_format json
| 输入内容 | 参数效果 | 预期结果 |
|---|---|---|
| Markdown 标题和段落 | --parse_mode auto | content_type=markdown,提取标题和段落 |
| HTML title 和 p 标签 | --parse_mode auto | content_type=html,提取标题和段落 |
| 普通文本 | --parse_mode auto | content_type=plain,首个非空行作为标题 |
空 text 字段 | 任意模式 | 输出 _parsed.error,不崩溃 |
{"_parsed": {"raw_text": "# Research Note...", "content_type": "markdown", "title": "Research Note", "paragraphs": ["Research Note", "First paragraph..."], "paragraph_count": 2, "char_count": 42, "word_count": 5, "parsed_at": "2026-06-12 14:00:00"}, "text": "# Research Note..."}
使用仓库内 Python 环境运行;Windows bash 下建议加 PYTHONIOENCODING=utf-8 避免中文控制台编码问题。HTML 解析优先使用 beautifulsoup4,缺少依赖时脚本会退回正则清理。
parse_mode=auto 会根据内容特征识别 plain、markdown 或 html。text 或 text 为空时,输出 _parsed.error。まだレビューはありません。使ってみた感想をお寄せください。
概要と使いどころ
领域缩略语展开 Skill:按内置或外部词典将独立缩略语替换为全称,可选在全称后保留原缩写。 适用于技术文本、论文摘要和业务记录中的缩写清洗;不负责模糊缩写消歧或大小写无关替换。
日本語の概要は準備中です。原文の説明を表示しています。
字母数字比例过滤器。过滤文本中字母/数字比例不在指定范围内的样本。 当用户提到文本过滤、比例筛选、字母比例、数字比例、清理乱码文本等需求时使用此skill。 即使用户没有明确说出"过滤",只要任务涉及根据文本中字母或数字的比例来筛选数据, 就应该使用此skill。
日本語の概要は準備中です。原文の説明を表示しています。
平均行长度过滤器。过滤文本平均行长度不在指定范围内的样本。 当用户提到行长度过滤、平均行长度、文本行长度筛选、按行筛选等需求时使用此skill。 即使用户没有明确说出"平均行长度",只要任务涉及根据文本中每行的平均长度来筛选数据, 就应该使用此skill。
日本語の概要は準備中です。原文の説明を表示しています。
批量文件清单采集器。扫描一个或多个本地文件/目录,或从任务列表加载路径, 按支持的扩展名生成文件元信息清单,供后续文本、表格、文档、图像等采集流程继续处理。 当用户需要批量盘点待采集文件、生成本地文件 manifest、统计输入文件类型或为后续采集算子准备文件清单时使用此 skill。
日本語の概要は準備中です。原文の説明を表示しています。
批量数据均匀分片工具。读取json/jsonl/csv输入,按份数或固定条数切成多个子文件,输出一个清单JSON供下游节点消费。 当用户提到数据分割、批量拆分、数据分片、均匀分块等需求时使用此skill。 即使用户没有明确说出"分片",只要任务是把整份批量数据均匀拆成多个文件,就应该使用此skill。 不负责按字段分组导出或随机采样。
日本語の概要は準備中です。原文の説明を表示しています。
本skill是用于单细胞测序数据分析的专用技能,首先需要用户上传需要处理的单细胞测序数据,再对经过预处理的单细胞表达数据进行自动化细胞类型注释。它通过基因比对、数据标准化、降维等一系列流程,将细胞聚类结果与已知参考数据库进行匹配,从而为每个细胞分配生物学功能标签。
日本語の概要は準備中です。原文の説明を表示しています。