Skip to content

Repository files navigation

Tibetan Muslims Knowledge Base & RAG Dataset

License: Source-Specific + MIT Metadata Dataset RAG GitHub Pages Release Hugging Face Ready

Dual-track Islamic knowledge base and public-web RAG dataset curated for human readers, researchers, and AI crawlers. This repository mirrors 22 public Chinese articles from the Salaam Alykum Tibetan Muslims topic, preserving Markdown, JSON/JSONL, RAG chunks, source URLs, canonical URLs, authors, timestamps, topic tags, and SHA-256 content hashes.

📖 Read Articles / 普通阅读入口

In the name of Allah ﷻ, the Most Gracious, the Most Merciful

All praise belongs to Allah. May Allah show mercy and help all those who love truth and justice. May Allah grant peace, safety, and blessings to our brothers and sisters.

🌐 Language Index


English

What is this repository?

This repository is the Salaam Alykum Tibetan Muslims Knowledge Base and RAG Dataset. It converts the public topic page https://salaamalykum.com/cn/topic/藏族穆斯林 into a GitHub-friendly archive with human-readable Markdown, machine-readable JSON/JSONL, RAG chunks, metadata, release notes, a static GitHub Pages site, and a Hugging Face-ready dataset card.

What is Salaamalykum.com?

Salaamalykum.com is a software platform built by Muslims to tell their real stories using their own voices and languages. It collects news, articles, and first-hand information about religious freedom, Islamic life, Tibetan Muslim and Hui communities, human rights, Halal life, and Muslim communities around the world.

What are we doing now?

We are preserving public Tibetan Muslim-related articles in a durable dual-track format. GitHub holds the human-readable archive and project navigation; the Hugging Face-ready files hold the machine-readable view for search, RAG, citation indexing, and responsible research.

Who are we?

Alhamdulillah, we are Muslims trying to build more decentralized, open-source, non-profit software for the global Muslim community, the Ummah. We want the code, metadata, and public knowledge structure to remain transparent, reusable, and safe.

What do we believe?

Follow Allah and do good. “By Time. The human being is in loss. Except those who believe, and do good works, and encourage truth, and recommend patience.” (Quran 103)

Community rules

  • No harmful content for users: no crime promotion, racism, spam, fake media, fake ads, or abusive manipulation.
  • No barriers for useful cooperation: we support lawful knowledge sharing and free, respectful cooperation between Muslim communities that speak different languages.
  • No private data in public archives: raw SQL dumps, passwords, tokens, cookies, sessions, IP logs, private tickets, and user tables are excluded.

Website languages

Focus on current Muslim human rights

This archive focuses on public articles about Tibetan Muslim identity, Khache communities, Tibet, Lhasa, Kashmir, Kalimpong, Nepal, migration memory, religious freedom, cultural continuity, education, citizenship, public evidence, and the wider human-rights situation of Muslims. Sharing these materials is not meant to spread despair; it is meant to preserve testimony, remind the Ummah of patience and unity, and keep source links visible for researchers and readers.

Chinese Quran project

Salaam Alykum also maintains a mobile-friendly Chinese Quran section with five Chinese translations for comparison and reflection. Chinese Quran mobile search: https://salaamalykum.com/cn/qurancn/mobile/

Why is this important?

When public memory is fragmented and online platforms change quickly, a release-locked archive with hashes, source URLs, canonical URLs, RSS, Atom, sitemap, and llms.txt makes the material easier to verify, cite, crawl, and preserve. This is a public-web archive, not a leak of private database content.

Software mission and open-source statement

  1. Completely open source: repository structure, metadata, QA reports, and scripts are public for review.
  2. Decentralized preservation: GitHub Pages, releases, Markdown, and JSONL reduce dependence on one presentation layer.
  3. Always free: the public archive is readable without payment.
  4. Purely non-profit: the goal is preservation, education, research, and service.

Project value and benchmark status

This repository is a dual-track deployment. The human-readable track provides normalized Markdown files and a static GitHub Pages site. The machine-readable track provides article JSON, JSONL, RAG chunks, metadata indexes, sitemap, RSS, Atom, and a Hugging Face-ready dataset card. Benchmark status: this is a reproducible public archive for the Salaam Alykum Tibetan Muslims topic; it does not make unverifiable ranking claims.

Dataset statistics and overview

Metric Count / Detail
Total articles 22
Total RAG chunks 22
Language Simplified Chinese (zh-Hans)
Primary source topic Tibetan Muslims / 藏族穆斯林
Human format Markdown in content/
Machine format JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Data schema

Field Type Description
article_id Integer Original public article ID.
title String Original article title.
source_url String Public source URL.
canonical_url String Canonical URL declared by the source page.
author String Public author name from the article page.
date_published String Publication timestamp.
date_modified String Last modified timestamp.
topic_tags List[String] Public topic tags.
content_sha256 String SHA-256 hash for deduplication and integrity checks.
content_markdown String Normalized Markdown article body.
text String RAG chunk text in data/rag_chunks.jsonl.

Sample RAG record and format truth

The native dataset is an article and RAG corpus. It is not a native ShareGPT or Alpaca conversation dataset. It can be transformed later into instruction-tuning examples only if a separate, truthful conversion step is documented.

{
  "chunk_id": "3348-001",
  "article_id": 3348,
  "title": "克什米尔藏族穆斯林发生了什么?129个家庭的流亡与身份困境",
  "source_url": "https://salaamalykum.com/cn/article/3348",
  "language": "zh-Hans",
  "text": "转载翻译..."
}

Data source

All included records come from public Salaam Alykum article pages under the Tibetan Muslims topic. The raw MySQL backup, private user data, credentials, and server secrets are not included.

Official links

How to cite

If you use this archive in research, search evaluation, RAG experiments, or public-interest reporting, cite the repository release and the original article URLs.

@dataset{salaamalykum_2026_tibetan_muslims_topic,
  author    = {Salaamalykum},
  title     = {Tibetan Muslims Knowledge Base & RAG Dataset},
  year      = {2026},
  publisher = {GitHub},
  url       = {https://github.com/salaamalykum/TibetanMuslims},
  version   = {v2026.07.30-tibetan-muslims-topic-22}
}

Update frequency

The repository is batch-synced from public pages. Every content batch must update the site lastmod, RSS/Atom update time, release version, dataset files, QA report, and release notes together.

License

Article bodies remain source-specific because many posts are translated or reposted public internet material. Repository scripts and generated metadata are offered under the MIT notice where the maintainer has rights to license them. See LICENSE, SECURITY.md, and metadata/source_policy.md.

Article index

For normal GitHub reading, use the Markdown article directory at content/README.md. The full machine-readable article index is available in metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl, and on GitHub Pages. Original Chinese titles are preserved so that every row can be traced back to the public source page.


Español

¿Qué es este repositorio?

Este repositorio es la Base de Conocimiento de Musulmanes Tibetanos y Dataset RAG de Salaam Alykum. Convierte la página pública del tema https://salaamalykum.com/cn/topic/藏族穆斯林 en un archivo compatible con GitHub que incluye Markdown para humanos, JSON/JSONL para máquinas, fragmentos RAG, metadatos, notas de lanzamiento, un sitio estático de GitHub Pages y una tarjeta de dataset lista para Hugging Face.

¿Qué es Salaamalykum.com?

Salaamalykum.com es una plataforma de software construida por musulmanes para contar sus historias reales con sus propias voces e idiomas. Reúne noticias, artículos e información de primera mano sobre libertad religiosa, vida islámica, comunidades musulmanas tibetanas y hui, derechos humanos, vida halal y comunidades musulmanas en todo el mundo.

¿Qué estamos haciendo ahora?

Estamos preservando artículos públicos relacionados con los musulmanes tibetanos en un formato duradero de doble vía. GitHub conserva el archivo legible por personas y la navegación del proyecto; los archivos listos para Hugging Face conservan la vista legible por máquinas para búsqueda, RAG, indexación de citas e investigación responsable.

¿Quiénes somos?

Alhamdulillah, somos musulmanes que intentan construir software más descentralizado, abierto y sin fines de lucro para la comunidad musulmana global, la Ummah. Queremos que el código, los metadatos y la estructura del conocimiento público sigan siendo transparentes, reutilizables y seguros.

¿Qué creemos?

Seguir a Allah y hacer el bien. “Por el Tiempo. El ser humano está en pérdida. Excepto quienes creen, hacen buenas obras, se recomiendan la verdad y se recomiendan la paciencia.” (Corán 103)

Reglas de la comunidad

  • Nada dañino para los usuarios: no promoción del crimen, racismo, spam, medios falsos, anuncios falsos ni manipulación abusiva.
  • Sin barreras para la cooperación útil: apoyamos el intercambio legal de conocimiento y la cooperación libre y respetuosa entre comunidades musulmanas que hablan distintos idiomas.
  • Sin datos privados en archivos públicos: se excluyen volcados SQL sin procesar, contraseñas, tokens, cookies, sesiones, registros IP, tickets privados y tablas de usuarios.

Idiomas del sitio web

Enfoque en los derechos humanos actuales de los musulmanes

Este archivo se centra en artículos públicos sobre identidad musulmana tibetana, Tíbet, Lhasa, Cachemira, Kalimpong y Nepal, libertad religiosa, memoria cultural, memoria migratoria, ciudadanía y educación, comunidades de diáspora y refugio, consumo ético, evidencia pública y la situación más amplia de los derechos humanos de los musulmanes. Compartir estos materiales no busca difundir desesperanza; busca preservar testimonios, recordar a la Ummah la paciencia y la unidad, y mantener visibles los enlaces de origen para investigadores y lectores.

Proyecto del Corán en chino

Salaam Alykum también mantiene una sección del Corán en chino, apta para móvil, con cinco traducciones chinas para comparación y reflexión. Búsqueda móvil del Corán en chino: https://salaamalykum.com/cn/qurancn/mobile/

¿Por qué es importante?

Cuando la memoria pública se fragmenta y las plataformas en línea cambian rápidamente, un archivo fijado por versión con hashes, URLs de origen, URLs canónicas, RSS, Atom, sitemap y llms.txt facilita verificar, citar, rastrear y preservar el material. Este es un archivo de web pública, no una filtración de contenido privado de base de datos.

Misión de software y declaración de código abierto

  1. Completamente abierto: la estructura del repositorio, los metadatos, los informes QA y los scripts son públicos para revisión.
  2. Preservación descentralizada: GitHub Pages, releases, Markdown y JSONL reducen la dependencia de una sola capa de presentación.
  3. Siempre gratis: el archivo público se puede leer sin pago.
  4. Puramente sin fines de lucro: el objetivo es preservación, educación, investigación y servicio.

Valor del proyecto y estado de referencia

Este repositorio es un despliegue de doble vía. La vía humana ofrece archivos Markdown normalizados y un sitio estático en GitHub Pages. La vía de máquinas ofrece JSON de artículos, JSONL, fragmentos RAG, índices de metadatos, sitemap, RSS, Atom y una tarjeta de dataset lista para Hugging Face. Estado de referencia: este es un archivo público reproducible para el tema de musulmanes tibetanos de Salaam Alykum; no hace afirmaciones de ranking no verificables.

Estadísticas y resumen del dataset

Métrica Conteo / Detalle
Artículos totales 74
Fragmentos RAG totales 74
Idioma Chino simplificado (zh-Hans)
Tema fuente principal Musulmanes Tibetanos / 藏族穆斯林
Formato humano Markdown en content/
Formato de máquina JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Esquema de datos

Campo Tipo Descripción
article_id Integer ID público original del artículo.
title String Título original del artículo.
source_url String URL pública de origen.
canonical_url String URL canónica declarada por la página fuente.
author String Nombre público del autor en la página del artículo.
date_published String Marca de tiempo de publicación.
date_modified String Marca de tiempo de última modificación.
topic_tags List[String] Etiquetas públicas del tema.
content_sha256 String Hash SHA-256 para deduplicación y comprobaciones de integridad.
content_markdown String Cuerpo normalizado del artículo en Markdown.
text String Texto del fragmento RAG en data/rag_chunks.jsonl.

Registro RAG de ejemplo y verdad del formato

El dataset nativo es un corpus de artículos y RAG. No es un dataset conversacional nativo ShareGPT ni Alpaca. Puede transformarse después en ejemplos de ajuste por instrucciones solo si se documenta un paso de conversión separado y veraz.

Fuente de datos

Todos los registros incluidos provienen de páginas públicas de artículos de Salaam Alykum bajo el tema de musulmanes tibetanos. No se incluye el respaldo MySQL bruto, datos privados de usuarios, credenciales ni secretos del servidor.

Enlaces oficiales

Cómo citar

Si usas este archivo en investigación, evaluación de búsqueda, experimentos RAG o periodismo de interés público, cita la release del repositorio y las URLs originales de los artículos.

Frecuencia de actualización

El repositorio se sincroniza por lotes desde páginas públicas. Cada lote de contenido debe actualizar juntos el lastmod del sitio, la hora de actualización de RSS/Atom, la versión de release, los archivos del dataset, el informe QA y las notas de release.

Licencia

Los cuerpos de los artículos siguen siendo específicos de la fuente porque muchas publicaciones son traducciones o republicaciones de material público de internet. Los scripts del repositorio y los metadatos generados se ofrecen bajo el aviso MIT cuando el mantenedor tiene derechos para licenciarlos. Consulta LICENSE, SECURITY.md y metadata/source_policy.md.

Índice de artículos

El índice completo está disponible en metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl y en GitHub Pages. Los títulos originales en chino se conservan para que cada fila pueda rastrearse hasta la página pública de origen.


中文

这个仓库是什么?

这个仓库是 Salaam Alykum 藏族穆斯林知识库与 RAG 数据集。它把公开话题页 https://salaamalykum.com/cn/topic/藏族穆斯林 转换成适合 GitHub 的归档形式,包括人类可读的 Markdown、机器可读的 JSON/JSONL、RAG chunks、元数据、Release 说明、GitHub Pages 静态站点,以及 Hugging Face-ready Dataset Card。

Salaamalykum.com 是什么?

Salaamalykum.com 是穆斯林建立的软件平台,用自己的声音和语言讲述真实故事。它收集关于宗教自由、伊斯兰生活、藏族穆斯林与回族社区、人权、清真生活,以及全球穆斯林社区的新闻、文章和第一手信息。

我们现在在做什么?

我们正在把与藏族穆斯林相关的公开文章保存为长期可用的双轨格式。GitHub 保存人类可读的归档和项目导航;Hugging Face-ready 文件保存机器可读视图,用于搜索、RAG、引用索引和负责任研究。

我们是谁?

Alhamdulillah,我们是穆斯林,正在为全球穆斯林共同体 Ummah 建设更去中心化、开源、非营利的软件。我们希望代码、元数据和公共知识结构保持透明、可复用、安全。

我们相信什么?

跟随 Allah,做善事。“以时光盟誓,人确是在亏折之中,惟信道而且行善,并以真理相劝、以坚忍相勉的人则不然。”(古兰经 103)

社区规则

  • 不允许伤害用户的内容:不允许犯罪推广、种族主义、垃圾信息、假媒体、假广告或滥用式操纵。
  • 不为有益合作设置障碍:我们支持合法知识分享,支持不同语言的穆斯林社区之间自由、尊重的合作。
  • 不把私密数据放进公开归档:原始 SQL 备份、密码、token、cookie、session、IP 日志、私人工单和用户表全部排除。

网站语言

关注当代穆斯林人权

本归档关注关于藏族穆斯林身份、西藏、拉萨、克什米尔、噶伦堡、尼泊尔、宗教自由、文化记忆、迁徙记忆、公民身份与教育、海外与难民社群、伦理消费、公开证据,以及更广泛穆斯林人权处境的公开文章。分享这些材料不是为了传播绝望,而是为了保存见证,提醒 Ummah 坚忍与团结,并让研究者和读者能够看到来源链接。

古兰经中文项目

Salaam Alykum 也维护一个适合移动端的古兰经中文栏目,提供五种中文译本,方便对照和沉思。古兰经中文移动端查询:https://salaamalykum.com/cn/qurancn/mobile/

为什么这很重要?

当公共记忆被碎片化、线上平台快速变化时,一个带有哈希、源 URL、canonical URL、RSS、Atom、sitemap 和 llms.txt 的固定 Release 归档,可以让材料更容易被核验、引用、爬取和保存。这是公开网页归档,不是私有数据库内容泄漏。

软件使命与开源声明

  1. 完全开源:仓库结构、元数据、QA 报告和脚本公开接受检查。
  2. 去中心化保存:GitHub Pages、Release、Markdown 和 JSONL 降低对单一展示层的依赖。
  3. 永远免费:公开归档无需付费即可阅读。
  4. 纯粹非营利:目标是保存、教育、研究和服务。

项目价值与基准状态

本仓库是双轨发布。人类阅读轨道提供规范化 Markdown 文件和 GitHub Pages 静态站点。机器阅读轨道提供 article JSON、JSONL、RAG chunks、元数据索引、sitemap、RSS、Atom 和 Hugging Face-ready Dataset Card。基准状态:这是 Salaam Alykum 藏族穆斯林话题的可复现公开归档;不做无法验证的排名宣称。

数据集统计与概览

指标 数量 / 详情
文章总数 74
RAG chunks 总数 74
语言 简体中文 (zh-Hans)
主要来源话题 Tibetan Muslims / 藏族穆斯林
人类格式 content/ 中的 Markdown
机器格式 JSON、JSONL、CSV、RSS、Atom、sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

数据结构

字段 类型 说明
article_id Integer 原始公开文章 ID。
title String 原始文章标题。
source_url String 公开来源 URL。
canonical_url String 来源页面声明的 canonical URL。
author String 文章页面显示的公开作者名。
date_published String 发布时间戳。
date_modified String 最后更新时间戳。
topic_tags List[String] 公开话题标签。
content_sha256 String 用于去重和完整性检查的 SHA-256 哈希。
content_markdown String 规范化 Markdown 正文。
text String data/rag_chunks.jsonl 中的 RAG chunk 文本。

RAG 样例与格式真实性

本数据集原生格式是文章与 RAG 语料库。它不是原生 ShareGPT 或 Alpaca 对话数据集。只有在单独、真实记录转换步骤后,才可以进一步转换成指令微调样例。

数据来源

所有记录都来自 Salaam Alykum「藏族穆斯林」话题下的公开文章页面。原始 MySQL 备份、私有用户数据、凭据和服务器秘密不包含在内。

官方链接

如何引用

如果你在研究、搜索评估、RAG 实验或公共利益报道中使用本归档,请引用仓库 Release 和原始文章 URL。

更新频率

本仓库按批次从公开页面同步。每个内容批次必须同时更新站点 lastmod、RSS/Atom 更新时间、Release 版本、数据集文件、QA 报告和 Release 说明。

许可

文章正文采用来源特定许可状态,因为许多帖子是对公开互联网材料的翻译或转载。仓库脚本和生成的元数据,在维护者拥有授权权利的范围内按 MIT notice 提供。请查看 LICENSESECURITY.mdmetadata/source_policy.md

文章索引

普通用户在 GitHub 阅读文章,请使用 content/README.md 中的 Markdown 文章目录。完整的机器可读文章索引位于 metadata/site_index.csvmetadata/site_index.jsonmetadata/article_index.jsonl 和 GitHub Pages。原始中文标题会被保留,以便每一行都能追溯到公开来源页面。


العربية الفصحى

ما هذا المستودع؟

هذا المستودع هو قاعدة معرفة المسلمين التبتيين ومجموعة بيانات RAG من Salaam Alykum. إنه يحوّل صفحة الموضوع العامة https://salaamalykum.com/cn/topic/藏族穆斯林 إلى أرشيف مناسب لـ GitHub يحتوي على Markdown للقرّاء، و JSON/JSONL للآلات، ومقاطع RAG، وبيانات وصفية، وملاحظات إصدار، وموقع GitHub Pages ثابت، وبطاقة Dataset جاهزة لـ Hugging Face.

ما هو Salaamalykum.com؟

Salaamalykum.com منصة برمجية بناها مسلمون ليروا قصصهم الحقيقية بأصواتهم ولغاتهم. تجمع المنصة أخباراً ومقالات ومعلومات مباشرة عن حرية الدين، والحياة الإسلامية، ومجتمعات المسلمين التبتيين والهوي، وحقوق الإنسان، والحياة الحلال، والمجتمعات المسلمة حول العالم.

ماذا نفعل الآن؟

نحن نحفظ المقالات العامة المرتبطة بالمسلمين التبتيين بصيغة مزدوجة طويلة الأمد. يحتفظ GitHub بالأرشيف المقروء للبشر وبملاحة المشروع؛ وتحتفظ الملفات الجاهزة لـ Hugging Face بالنسخة المقروءة آلياً للبحث وRAG وفهرسة الاقتباسات والبحث المسؤول.

من نحن؟

الحمد لله، نحن مسلمون نحاول بناء برمجيات أكثر لامركزية ومفتوحة المصدر وغير ربحية للأمة المسلمة العالمية. نريد أن تبقى الشفرة والبيانات الوصفية وبنية المعرفة العامة شفافة وقابلة لإعادة الاستخدام وآمنة.

بماذا نؤمن؟

اتبعوا الله وافعلوا الخير. “والعصر. إن الإنسان لفي خسر. إلا الذين آمنوا وعملوا الصالحات وتواصوا بالحق وتواصوا بالصبر.” (القرآن 103)

قواعد المجتمع

  • لا محتوى ضاراً للمستخدمين: لا ترويج للجريمة أو العنصرية أو الرسائل المزعجة أو الإعلام المزيّف أو الإعلانات المزيّفة أو التلاعب المسيء.
  • لا حواجز أمام التعاون النافع: ندعم تبادل المعرفة القانوني والتعاون الحر والمحترم بين المجتمعات المسلمة ذات اللغات المختلفة.
  • لا بيانات خاصة في الأرشيفات العامة: تُستبعد نسخ SQL الخام، وكلمات المرور، والرموز، وملفات cookie، والجلسات، وسجلات IP، والتذاكر الخاصة، وجداول المستخدمين.

لغات الموقع

التركيز على حقوق الإنسان الحالية للمسلمين

يركز هذا الأرشيف على مقالات عامة عن الهوية المسلمة التبتية، والتبت ولاسا وكشمير وكاليمبونغ ونيبال، وحرية الدين، والذاكرة الثقافية، وذاكرة الهجرة والمواطنة والتعليم، ومجتمعات الشتات واللاجئين، والاستهلاك الأخلاقي، والأدلة العامة، والوضع الأوسع لحقوق الإنسان للمسلمين. نشر هذه المواد لا يهدف إلى نشر اليأس؛ بل يهدف إلى حفظ الشهادة، وتذكير الأمة بالصبر والوحدة، وإبقاء روابط المصادر ظاهرة للباحثين والقرّاء.

مشروع القرآن الصيني

يحافظ Salaam Alykum أيضاً على قسم قرآن صيني مناسب للهاتف، يضم خمس ترجمات صينية للمقارنة والتدبر. بحث القرآن الصيني للهاتف: https://salaamalykum.com/cn/qurancn/mobile/

لماذا هذا مهم؟

عندما تتجزأ الذاكرة العامة وتتغير المنصات بسرعة، فإن أرشيفاً مثبتاً بإصدار مع hashes وروابط مصدر وروابط canonical وRSS وAtom وsitemap وllms.txt يجعل المادة أسهل للتحقق والاقتباس والزحف والحفظ. هذا أرشيف ويب عام وليس تسريباً لمحتوى قاعدة بيانات خاصة.

رسالة البرمجيات وبيان المصدر المفتوح

  1. مفتوح المصدر تماماً: بنية المستودع والبيانات الوصفية وتقارير QA والسكربتات عامة للمراجعة.
  2. حفظ لامركزي: GitHub Pages والإصدارات وMarkdown وJSONL تقلل الاعتماد على طبقة عرض واحدة.
  3. مجاني دائماً: يمكن قراءة الأرشيف العام بلا دفع.
  4. غير ربحي تماماً: الهدف هو الحفظ والتعليم والبحث والخدمة.

قيمة المشروع وحالة المعيار

هذا المستودع نشر مزدوج المسار. يقدم مسار البشر ملفات Markdown منظمة وموقع GitHub Pages ثابتاً. ويقدم مسار الآلات JSON للمقالات وJSONL ومقاطع RAG وفهارس بيانات وصفية وsitemap وRSS وAtom وبطاقة Dataset جاهزة لـ Hugging Face. حالة المعيار: هذا أرشيف عام قابل لإعادة الإنتاج لموضوع المسلمين التبتيين في Salaam Alykum؛ ولا يقدم ادعاءات ترتيب غير قابلة للتحقق.

إحصاءات dataset ونظرة عامة

المقياس العدد / التفصيل
مجموع المقالات 74
مجموع مقاطع RAG 74
اللغة الصينية المبسطة (zh-Hans)
موضوع المصدر الأساسي Tibetan Muslims / 藏族穆斯林
صيغة البشر Markdown في content/
صيغة الآلات JSON وJSONL وCSV وRSS وAtom وsitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
الإصدار v2026.07.30-tibetan-muslims-topic-22

مخطط البيانات

الحقل النوع الوصف
article_id Integer معرف المقال العام الأصلي.
title String عنوان المقال الأصلي.
source_url String رابط المصدر العام.
canonical_url String الرابط canonical الذي تعلنه صفحة المصدر.
author String اسم الكاتب العام من صفحة المقال.
date_published String طابع وقت النشر.
date_modified String طابع وقت آخر تعديل.
topic_tags List[String] وسوم الموضوع العامة.
content_sha256 String hash SHA-256 لإزالة التكرار وفحص السلامة.
content_markdown String متن المقال المنظم بصيغة Markdown.
text String نص مقطع RAG في data/rag_chunks.jsonl.

مثال RAG وحقيقة الصيغة

الصيغة الأصلية لمجموعة البيانات هي Corpus مقالات وRAG. ليست مجموعة محادثات ShareGPT أو Alpaca أصلية. يمكن تحويلها لاحقاً إلى أمثلة ضبط بالتعليمات فقط إذا وُثقت خطوة تحويل منفصلة وصادقة.

مصدر البيانات

كل السجلات المضمنة تأتي من صفحات مقالات عامة في Salaam Alykum تحت موضوع المسلمين التبتيين. لا يتضمن المستودع نسخة MySQL الخام، أو بيانات المستخدمين الخاصة، أو بيانات الاعتماد، أو أسرار الخادم.

الروابط الرسمية

طريقة الاقتباس

إذا استخدمت هذا الأرشيف في بحث أو تقييم بحث أو تجارب RAG أو تقارير ذات مصلحة عامة، فاذكر إصدار المستودع وروابط المقالات الأصلية.

تكرار التحديث

يُزامن المستودع على دفعات من الصفحات العامة. يجب أن تحدّث كل دفعة محتوى معاً قيمة lastmod للموقع ووقت تحديث RSS/Atom ونسخة الإصدار وملفات dataset وتقرير QA وملاحظات الإصدار.

الترخيص

تبقى متون المقالات خاضعة لشروط المصدر لأن كثيراً من المنشورات ترجمات أو إعادة نشر لمواد عامة من الإنترنت. سكربتات المستودع والبيانات الوصفية المولدة تُقدم تحت إشعار MIT حيث يملك المشرف حق ترخيصها. راجع LICENSE وSECURITY.md وmetadata/source_policy.md.

فهرس المقالات

الفهرس الكامل متاح في metadata/site_index.csv وmetadata/site_index.json وmetadata/article_index.jsonl وعلى GitHub Pages. تُحفظ العناوين الصينية الأصلية حتى يمكن تتبع كل صف إلى صفحة المصدر العامة.


हिन्दी

यह रिपॉज़िटरी क्या है?

यह रिपॉज़िटरी Salaam Alykum Muçulmanos Tibetanos Knowledge Base और RAG Dataset है। यह सार्वजनिक विषय पेज https://salaamalykum.com/cn/topic/藏族穆斯林 को GitHub के लिए उपयुक्त आर्काइव में बदलती है, जिसमें मानव-पठनीय Markdown, मशीन-पठनीय JSON/JSONL, RAG chunks, metadata, release notes, static GitHub Pages site और Hugging Face-ready dataset card शामिल हैं।

Salaamalykum.com क्या है?

Salaamalykum.com मुसलमानों द्वारा बनाया गया software platform है, ताकि वे अपनी वास्तविक कहानियाँ अपनी आवाज़ों और भाषाओं में बता सकें। यह धार्मिक स्वतंत्रता, इस्लामी जीवन, Tibetan Muslim और Hui समुदायों, मानवाधिकार, Halal जीवन और दुनिया भर की मुस्लिम communities पर news, articles और first-hand information इकट्ठा करता है।

हम अभी क्या कर रहे हैं?

हम Tibetan Muslim-संबंधित सार्वजनिक लेखों को टिकाऊ dual-track format में संरक्षित कर रहे हैं। GitHub मानव-पठनीय archive और project navigation रखता है; Hugging Face-ready files search, RAG, citation indexing और responsible research के लिए machine-readable view रखती हैं।

हम कौन हैं?

Alhamdulillah, हम मुसलमान हैं और global Muslim community, यानी Ummah, के लिए अधिक decentralized, open-source और non-profit software बनाने की कोशिश कर रहे हैं। हम चाहते हैं कि code, metadata और public knowledge structure पारदर्शी, reusable और सुरक्षित रहें।

हम क्या मानते हैं?

Allah का पालन करो और नेक काम करो। “समय की क़सम। मनुष्य घाटे में है। सिवाय उन लोगों के जो ईमान लाए, नेक काम किए, सत्य की नसीहत की और सब्र की नसीहत की।” (Quran 103)

Community rules

  • Users के लिए harmful content नहीं: crime promotion, racism, spam, fake media, fake ads या abusive manipulation नहीं।
  • Useful cooperation पर barrier नहीं: हम अलग-अलग भाषाएँ बोलने वाली Muslim communities के बीच lawful knowledge sharing और free, respectful cooperation का समर्थन करते हैं।
  • Public archives में private data नहीं: raw SQL dumps, passwords, tokens, cookies, sessions, IP logs, private tickets और user tables बाहर रखे गए हैं।

Website languages

वर्तमान मुस्लिम मानवाधिकारों पर ध्यान

यह archive Tibetan Muslim identity, Khache communities, Tibet, Lhasa, Kashmir, Kalimpong, Nepal, migration memory, religious freedom, cultural continuity, education, citizenship, public evidence और Muslims की व्यापक human-rights situation पर public articles पर केंद्रित है। इन materials को साझा करना निराशा फैलाने के लिए नहीं है; इसका उद्देश्य testimony को बचाना, Ummah को patience और unity की याद दिलाना, और researchers तथा readers के लिए source links को visible रखना है।

Chinese Quran project

Salaam Alykum पाँच Chinese translations के साथ एक mobile-friendly Chinese Quran section भी रखता है, ताकि comparison और reflection हो सके। Chinese Quran mobile search: https://salaamalykum.com/cn/qurancn/mobile/

यह क्यों महत्वपूर्ण है?

जब public memory बिखरती है और online platforms तेज़ी से बदलते हैं, तो hashes, source URLs, canonical URLs, RSS, Atom, sitemap और llms.txt वाला release-locked archive material को verify, cite, crawl और preserve करना आसान बनाता है। यह public-web archive है, private database content leak नहीं।

Software mission और open-source statement

  1. Completely open source: repository structure, metadata, QA reports और scripts review के लिए public हैं।
  2. Decentralized preservation: GitHub Pages, releases, Markdown और JSONL एक presentation layer पर dependence कम करते हैं।
  3. Always free: public archive बिना payment पढ़ा जा सकता है।
  4. Purely non-profit: लक्ष्य preservation, education, research और service है।

Project value और benchmark status

यह repository dual-track deployment है। Human-readable track normalized Markdown files और static GitHub Pages site देता है। Machine-readable track article JSON, JSONL, RAG chunks, metadata indexes, sitemap, RSS, Atom और Hugging Face-ready dataset card देता है। Benchmark status: यह Salaam Alykum Tibetan Muslims topic के लिए reproducible public archive है; यह unverifiable ranking claims नहीं करता।

Dataset statistics और overview

Metric Count / Detail
Total articles 22
Total RAG chunks 22
Language Simplified Chinese (zh-Hans)
Primary source topic Tibetan Muslims / 藏族穆斯林
Human format content/ में Markdown
Machine format JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Data schema

Field Type Description
article_id Integer Original public article ID.
title String Original article title.
source_url String Public source URL.
canonical_url String Source page द्वारा declared canonical URL.
author String Article page से public author name.
date_published String Publication timestamp.
date_modified String Last modified timestamp.
topic_tags List[String] Public topic tags.
content_sha256 String Deduplication और integrity checks के लिए SHA-256 hash.
content_markdown String Normalized Markdown article body.
text String data/rag_chunks.jsonl में RAG chunk text.

Sample RAG record और format truth

Native dataset article और RAG corpus है। यह native ShareGPT या Alpaca conversation dataset नहीं है। इसे instruction-tuning examples में बाद में केवल तब बदला जा सकता है जब अलग और truthful conversion step document किया जाए।

Data source

सभी included records Salaam Alykum के Tibetan Muslims topic के public article pages से आते हैं। Raw MySQL backup, private user data, credentials और server secrets शामिल नहीं हैं।

Official links

How to cite

यदि आप इस archive को research, search evaluation, RAG experiments या public-interest reporting में उपयोग करते हैं, तो repository release और original article URLs cite करें।

Update frequency

Repository public pages से batch-synced है। हर content batch को site lastmod, RSS/Atom update time, release version, dataset files, QA report और release notes को साथ-साथ update करना चाहिए।

License

Article bodies source-specific रहते हैं क्योंकि कई posts translated या reposted public internet material हैं। Repository scripts और generated metadata MIT notice के तहत दिए जाते हैं जहाँ maintainer के पास उन्हें license करने का अधिकार है। LICENSE, SECURITY.md और metadata/source_policy.md देखें।

Article index

Full article index metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl और GitHub Pages में उपलब्ध है। Original Chinese titles preserved हैं ताकि हर row को public source page तक trace किया जा सके।


Français

Qu’est-ce que ce dépôt ?

Ce dépôt est la base de connaissance des musulmans tibétains et le dataset RAG de Salaam Alykum. Il transforme la page publique https://salaamalykum.com/cn/topic/藏族穆斯林 en archive adaptée à GitHub avec Markdown lisible par les humains, JSON/JSONL lisible par les machines, fragments RAG, métadonnées, notes de version, site statique GitHub Pages et carte de dataset prête pour Hugging Face.

Qu’est-ce que Salaamalykum.com ?

Salaamalykum.com est une plateforme logicielle créée par des musulmans pour raconter leurs histoires réelles avec leurs propres voix et langues. Elle rassemble nouvelles, articles et informations directes sur la liberté religieuse, la vie islamique, les communautés musulmanes tibétaines et hui, les droits humains, la vie halal et les communautés musulmanes du monde entier.

Que faisons-nous maintenant ?

Nous préservons les articles publics liés aux musulmans tibétains dans un format durable à double voie. GitHub contient l’archive lisible par les humains et la navigation du projet ; les fichiers prêts pour Hugging Face contiennent la vue lisible par les machines pour la recherche, le RAG, l’indexation des citations et la recherche responsable.

Qui sommes-nous ?

Alhamdulillah, nous sommes des musulmans qui essayons de construire des logiciels plus décentralisés, open source et à but non lucratif pour la communauté musulmane mondiale, la Ummah. Nous voulons que le code, les métadonnées et la structure de connaissance publique restent transparents, réutilisables et sûrs.

Que croyons-nous ?

Suivre Allah et faire le bien. « Par le Temps. L’être humain est certes en perdition, sauf ceux qui croient, accomplissent les bonnes œuvres, s’enjoignent la vérité et s’enjoignent la patience. » (Coran 103)

Règles communautaires

  • Aucun contenu nuisible aux utilisateurs : pas de promotion du crime, de racisme, de spam, de faux médias, de fausses publicités ni de manipulation abusive.
  • Aucun obstacle à la coopération utile : nous soutenons le partage légal du savoir et la coopération libre et respectueuse entre communautés musulmanes de langues différentes.
  • Aucune donnée privée dans les archives publiques : dumps SQL bruts, mots de passe, tokens, cookies, sessions, journaux IP, tickets privés et tables utilisateurs sont exclus.

Langues du site

Focus sur les droits humains musulmans actuels

Cette archive se concentre sur des articles publics concernant l’identité musulmane tibétaine, le Tibet, Lhassa, Cachemire, Kalimpong et Népal, la liberté religieuse, la mémoire culturelle, le mémoire migratoire, citoyenneté et éducation, les communautés de diaspora et de réfugiés, la consommation éthique, les preuves publiques et la situation plus large des droits humains des musulmans. Partager ces documents ne vise pas à diffuser le désespoir ; il s’agit de préserver les témoignages, de rappeler à la Ummah la patience et l’unité, et de garder les liens sources visibles pour chercheurs et lecteurs.

Projet du Coran chinois

Salaam Alykum maintient aussi une section mobile du Coran chinois avec cinq traductions chinoises pour comparaison et réflexion. Recherche mobile du Coran chinois : https://salaamalykum.com/cn/qurancn/mobile/

Pourquoi est-ce important ?

Lorsque la mémoire publique se fragmente et que les plateformes changent rapidement, une archive verrouillée par release avec hashes, URLs sources, URLs canoniques, RSS, Atom, sitemap et llms.txt rend le contenu plus facile à vérifier, citer, crawler et préserver. C’est une archive du web public, pas une fuite de base de données privée.

Mission logicielle et déclaration open source

  1. Entièrement open source : structure du dépôt, métadonnées, rapports QA et scripts sont publics pour examen.
  2. Préservation décentralisée : GitHub Pages, releases, Markdown et JSONL réduisent la dépendance à une seule couche de présentation.
  3. Toujours gratuit : l’archive publique est lisible sans paiement.
  4. Purement non lucratif : l’objectif est la préservation, l’éducation, la recherche et le service.

Valeur du projet et statut de référence

Ce dépôt est un déploiement à double voie. La voie humaine fournit des fichiers Markdown normalisés et un site statique GitHub Pages. La voie machine fournit JSON d’articles, JSONL, fragments RAG, index de métadonnées, sitemap, RSS, Atom et carte de dataset prête pour Hugging Face. Statut de référence : c’est une archive publique reproductible pour le sujet des musulmans tibétains de Salaam Alykum ; elle ne fait pas d’affirmations de classement invérifiables.

Statistiques et aperçu du dataset

Métrique Nombre / Détail
Articles totaux 74
Fragments RAG totaux 74
Langue Chinois simplifié (zh-Hans)
Sujet source principal Tibetan Muslims / 藏族穆斯林
Format humain Markdown dans content/
Format machine JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Schéma de données

Champ Type Description
article_id Integer Identifiant public original de l’article.
title String Titre original de l’article.
source_url String URL publique source.
canonical_url String URL canonique déclarée par la page source.
author String Nom public de l’auteur sur la page.
date_published String Horodatage de publication.
date_modified String Horodatage de dernière modification.
topic_tags List[String] Tags publics du sujet.
content_sha256 String Hash SHA-256 pour déduplication et intégrité.
content_markdown String Corps d’article normalisé en Markdown.
text String Texte du fragment RAG dans data/rag_chunks.jsonl.

Exemple RAG et vérité du format

Le dataset natif est un corpus d’articles et de RAG. Ce n’est pas un dataset conversationnel natif ShareGPT ou Alpaca. Il peut être transformé plus tard en exemples d’instruction-tuning seulement si une étape de conversion séparée et véridique est documentée.

Source des données

Tous les enregistrements inclus proviennent de pages publiques d’articles Salaam Alykum sous le sujet des musulmans tibétains. Le backup MySQL brut, les données privées des utilisateurs, les identifiants et les secrets serveur ne sont pas inclus.

Liens officiels

Comment citer

Si vous utilisez cette archive pour la recherche, l’évaluation de recherche, les expériences RAG ou un reportage d’intérêt public, citez la release du dépôt et les URLs originales des articles.

Fréquence de mise à jour

Le dépôt est synchronisé par lots depuis des pages publiques. Chaque lot de contenu doit mettre à jour ensemble le lastmod du site, l’heure RSS/Atom, la version de release, les fichiers du dataset, le rapport QA et les notes de release.

Licence

Les corps d’articles restent soumis aux droits propres à leurs sources, car beaucoup de publications sont des traductions ou republications de matériaux publics du web. Les scripts du dépôt et les métadonnées générées sont proposés sous notice MIT lorsque le mainteneur a le droit de les licencier. Voir LICENSE, SECURITY.md et metadata/source_policy.md.

Index des articles

L’index complet est disponible dans metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl et sur GitHub Pages. Les titres chinois originaux sont conservés afin que chaque ligne puisse être reliée à la page source publique.


Bahasa Indonesia

Apa repositori ini?

Repositori ini adalah Salaam Alykum Tibetan Muslims Knowledge Base dan RAG Dataset. Repositori ini mengubah halaman topik publik https://salaamalykum.com/cn/topic/藏族穆斯林 menjadi arsip ramah GitHub yang berisi Markdown untuk manusia, JSON/JSONL untuk mesin, RAG chunks, metadata, catatan rilis, situs statis GitHub Pages, dan dataset card siap Hugging Face.

Apa itu Salaamalykum.com?

Salaamalykum.com adalah platform perangkat lunak yang dibangun oleh Muslim untuk menceritakan kisah nyata mereka dengan suara dan bahasa mereka sendiri. Platform ini mengumpulkan berita, artikel, dan informasi langsung tentang kebebasan beragama, kehidupan Islam, komunitas Muslim Tibet dan Hui, hak asasi manusia, kehidupan halal, dan komunitas Muslim di seluruh dunia.

Apa yang sedang kami lakukan sekarang?

Kami melestarikan artikel publik terkait Muslim Tibet dalam format dua jalur yang tahan lama. GitHub menyimpan arsip yang dapat dibaca manusia dan navigasi proyek; file siap Hugging Face menyimpan tampilan yang dapat dibaca mesin untuk pencarian, RAG, pengindeksan sitasi, dan riset bertanggung jawab.

Siapa kami?

Alhamdulillah, kami adalah Muslim yang berusaha membangun perangkat lunak yang lebih terdesentralisasi, open-source, dan nirlaba untuk komunitas Muslim global, Ummah. Kami ingin kode, metadata, dan struktur pengetahuan publik tetap transparan, dapat digunakan kembali, dan aman.

Apa yang kami yakini?

Ikuti Allah dan lakukan kebaikan. “Demi masa. Sesungguhnya manusia berada dalam kerugian. Kecuali orang-orang yang beriman, beramal saleh, saling menasihati dalam kebenaran, dan saling menasihati dalam kesabaran.” (Quran 103)

Aturan komunitas

  • Tidak ada konten berbahaya bagi pengguna: tidak ada promosi kriminal, rasisme, spam, media palsu, iklan palsu, atau manipulasi abusif.
  • Tidak ada hambatan untuk kerja sama yang bermanfaat: kami mendukung berbagi pengetahuan yang sah dan kerja sama bebas serta saling menghormati antar komunitas Muslim yang berbicara bahasa berbeda.
  • Tidak ada data privat dalam arsip publik: dump SQL mentah, kata sandi, token, cookie, sesi, log IP, tiket privat, dan tabel pengguna dikecualikan.

Bahasa situs web

Fokus pada hak asasi Muslim saat ini

Arsip ini berfokus pada artikel publik tentang identitas Muslim Tibet, Tibet, Lhasa, Kashmir, Kalimpong, Nepal, kebebasan beragama, memori budaya, memori migrasi, kewarganegaraan, dan pendidikan, komunitas diaspora dan pengungsi, konsumsi etis, bukti publik, dan situasi hak asasi Muslim yang lebih luas. Membagikan materi ini bukan untuk menyebarkan keputusasaan; tujuannya adalah menjaga kesaksian, mengingatkan Ummah tentang kesabaran dan persatuan, serta menjaga tautan sumber tetap terlihat bagi peneliti dan pembaca.

Proyek Quran bahasa Mandarin

Salaam Alykum juga mengelola bagian Quran bahasa Mandarin yang ramah seluler dengan lima terjemahan Mandarin untuk perbandingan dan refleksi. Pencarian Quran Mandarin seluler: https://salaamalykum.com/cn/qurancn/mobile/

Mengapa ini penting?

Ketika memori publik terpecah dan platform online cepat berubah, arsip terkunci rilis dengan hash, URL sumber, URL kanonik, RSS, Atom, sitemap, dan llms.txt membuat materi lebih mudah diverifikasi, dikutip, dirayapi, dan dilestarikan. Ini adalah arsip web publik, bukan kebocoran konten database privat.

Misi perangkat lunak dan pernyataan open source

  1. Sepenuhnya open source: struktur repositori, metadata, laporan QA, dan skrip terbuka untuk ditinjau.
  2. Pelestarian terdesentralisasi: GitHub Pages, rilis, Markdown, dan JSONL mengurangi ketergantungan pada satu lapisan tampilan.
  3. Selalu gratis: arsip publik dapat dibaca tanpa pembayaran.
  4. Murni nirlaba: tujuannya adalah pelestarian, pendidikan, penelitian, dan pelayanan.

Nilai proyek dan status benchmark

Repositori ini adalah deployment dua jalur. Jalur manusia menyediakan file Markdown ternormalisasi dan situs statis GitHub Pages. Jalur mesin menyediakan JSON artikel, JSONL, RAG chunks, indeks metadata, sitemap, RSS, Atom, dan dataset card siap Hugging Face. Status benchmark: ini adalah arsip publik yang dapat direproduksi untuk topik Muslim Tibet Salaam Alykum; tidak membuat klaim peringkat yang tidak dapat diverifikasi.

Statistik dan ringkasan dataset

Metrik Jumlah / Detail
Total artikel 74
Total RAG chunks 22
Bahasa Mandarin Sederhana (zh-Hans)
Topik sumber utama Tibetan Muslims / 藏族穆斯林
Format manusia Markdown di content/
Format mesin JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Rilis v2026.07.30-tibetan-muslims-topic-22

Skema data

Field Tipe Deskripsi
article_id Integer ID artikel publik asli.
title String Judul artikel asli.
source_url String URL sumber publik.
canonical_url String URL kanonik yang dideklarasikan halaman sumber.
author String Nama penulis publik dari halaman artikel.
date_published String Timestamp publikasi.
date_modified String Timestamp modifikasi terakhir.
topic_tags List[String] Tag topik publik.
content_sha256 String Hash SHA-256 untuk deduplikasi dan pemeriksaan integritas.
content_markdown String Isi artikel Markdown yang dinormalisasi.
text String Teks RAG chunk di data/rag_chunks.jsonl.

Contoh RAG dan kebenaran format

Dataset asli adalah korpus artikel dan RAG. Ini bukan dataset percakapan native ShareGPT atau Alpaca. Dataset ini hanya boleh diubah menjadi contoh instruction-tuning jika langkah konversi yang terpisah dan jujur didokumentasikan.

Sumber data

Semua record berasal dari halaman artikel publik Salaam Alykum di bawah topik Muslim Tibet. Backup MySQL mentah, data privat pengguna, kredensial, dan rahasia server tidak disertakan.

Tautan resmi

Cara mengutip

Jika Anda menggunakan arsip ini dalam riset, evaluasi pencarian, eksperimen RAG, atau pelaporan kepentingan publik, kutip rilis repositori dan URL artikel asli.

Frekuensi pembaruan

Repositori ini disinkronkan secara batch dari halaman publik. Setiap batch konten harus memperbarui lastmod situs, waktu pembaruan RSS/Atom, versi rilis, file dataset, laporan QA, dan catatan rilis secara bersamaan.

Lisensi

Isi artikel tetap source-specific karena banyak posting adalah terjemahan atau repost materi internet publik. Skrip repositori dan metadata yang dihasilkan ditawarkan di bawah pemberitahuan MIT jika maintainer memiliki hak untuk melisensikannya. Lihat LICENSE, SECURITY.md, dan metadata/source_policy.md.

Indeks artikel

Indeks lengkap tersedia di metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl, dan GitHub Pages. Judul asli bahasa Mandarin dipertahankan agar setiap baris dapat dilacak kembali ke halaman sumber publik.


বাংলা

এই রিপোজিটরি কী?

এই রিপোজিটরি হলো Salaam Alykum Tibetan Muslims Knowledge Base এবং RAG Dataset। এটি https://salaamalykum.com/cn/topic/藏族穆斯林 প্রকাশ্য টপিক পেজকে GitHub-উপযোগী আর্কাইভে রূপান্তর করে, যেখানে মানুষের জন্য Markdown, মেশিনের জন্য JSON/JSONL, RAG chunks, metadata, release notes, static GitHub Pages site এবং Hugging Face-ready dataset card আছে।

Salaamalykum.com কী?

Salaamalykum.com হলো মুসলিমদের তৈরি একটি software platform, যাতে তারা নিজেদের বাস্তব গল্প নিজেদের ভাষা ও কণ্ঠে বলতে পারে। এটি ধর্মীয় স্বাধীনতা, ইসলামী জীবন, Tibetan Muslim ও Hui community, মানবাধিকার, Halal life এবং বিশ্বব্যাপী Muslim communities সম্পর্কে news, articles এবং first-hand information সংগ্রহ করে।

আমরা এখন কী করছি?

আমরা Tibetan Muslim-সম্পর্কিত প্রকাশ্য নিবন্ধকে দীর্ঘস্থায়ী dual-track format-এ সংরক্ষণ করছি। GitHub মানুষের-পাঠযোগ্য archive এবং project navigation রাখে; Hugging Face-ready files search, RAG, citation indexing এবং responsible research-এর জন্য machine-readable view রাখে।

আমরা কারা?

Alhamdulillah, আমরা মুসলিম এবং global Muslim community, অর্থাৎ Ummah-এর জন্য আরও decentralized, open-source এবং non-profit software তৈরি করার চেষ্টা করছি। আমরা চাই code, metadata এবং public knowledge structure স্বচ্ছ, reusable এবং নিরাপদ থাকুক।

আমরা কী বিশ্বাস করি?

Allah-কে অনুসরণ করো এবং ভালো কাজ করো। “সময়ের শপথ। নিশ্চয় মানুষ ক্ষতির মধ্যে। তবে যারা ঈমান আনে, সৎকর্ম করে, সত্যের উপদেশ দেয় এবং ধৈর্যের উপদেশ দেয় তারা ব্যতীত।” (Quran 103)

Community rules

  • ব্যবহারকারীর জন্য ক্ষতিকর content নয়: crime promotion, racism, spam, fake media, fake ads বা abusive manipulation নয়।
  • উপকারী cooperation-এর পথে বাধা নয়: বিভিন্ন ভাষাভাষী Muslim communities-এর মধ্যে lawful knowledge sharing এবং free, respectful cooperation আমরা সমর্থন করি।
  • public archives-এ private data নয়: raw SQL dumps, passwords, tokens, cookies, sessions, IP logs, private tickets এবং user tables বাদ দেওয়া হয়েছে।

Website languages

বর্তমান Muslim human rights-এ ফোকাস

এই archive Tibetan Muslim identity, Khache communities, Tibet, Lhasa, Kashmir, Kalimpong, Nepal, migration memory, religious freedom, cultural continuity, education, citizenship, public evidence এবং Muslims-এর বিস্তৃত human-rights situation নিয়ে প্রকাশ্য articles-এ ফোকাস করে। এসব material share করার উদ্দেশ্য হতাশা ছড়ানো নয়; উদ্দেশ্য testimony সংরক্ষণ করা, Ummah-কে patience ও unity স্মরণ করানো, এবং researchers ও readers-এর জন্য source links দৃশ্যমান রাখা।

Chinese Quran project

Salaam Alykum পাঁচটি Chinese translation সহ mobile-friendly Chinese Quran section-ও রক্ষণাবেক্ষণ করে, যাতে comparison এবং reflection করা যায়। Chinese Quran mobile search: https://salaamalykum.com/cn/qurancn/mobile/

কেন এটি গুরুত্বপূর্ণ?

যখন public memory খণ্ডিত হয় এবং online platforms দ্রুত বদলে যায়, তখন hashes, source URLs, canonical URLs, RSS, Atom, sitemap এবং llms.txt সহ release-locked archive material verify, cite, crawl এবং preserve করা সহজ করে। এটি public-web archive, private database content leak নয়।

Software mission এবং open-source statement

  1. Completely open source: repository structure, metadata, QA reports এবং scripts review-এর জন্য public।
  2. Decentralized preservation: GitHub Pages, releases, Markdown এবং JSONL একক presentation layer-এর ওপর dependence কমায়।
  3. Always free: public archive payment ছাড়াই পড়া যায়।
  4. Purely non-profit: লক্ষ্য preservation, education, research এবং service।

Project value এবং benchmark status

এই repository একটি dual-track deployment। Human-readable track normalized Markdown files এবং static GitHub Pages site দেয়। Machine-readable track article JSON, JSONL, RAG chunks, metadata indexes, sitemap, RSS, Atom এবং Hugging Face-ready dataset card দেয়। Benchmark status: এটি Salaam Alykum Tibetan Muslims topic-এর জন্য reproducible public archive; এটি unverifiable ranking claims করে না।

Dataset statistics এবং overview

Metric Count / Detail
Total articles 22
Total RAG chunks 22
Language Simplified Chinese (zh-Hans)
Primary source topic Tibetan Muslims / 藏族穆斯林
Human format content/-এ Markdown
Machine format JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Data schema

Field Type Description
article_id Integer Original public article ID.
title String Original article title.
source_url String Public source URL.
canonical_url String Source page-declared canonical URL.
author String Article page-এর public author name.
date_published String Publication timestamp.
date_modified String Last modified timestamp.
topic_tags List[String] Public topic tags.
content_sha256 String Deduplication এবং integrity checks-এর জন্য SHA-256 hash.
content_markdown String Normalized Markdown article body.
text String data/rag_chunks.jsonl-এর RAG chunk text.

Sample RAG record এবং format truth

Native dataset হলো article এবং RAG corpus। এটি native ShareGPT বা Alpaca conversation dataset নয়। আলাদা ও truthful conversion step document করা হলে তবেই পরে instruction-tuning examples-এ রূপান্তর করা যায়।

Data source

সব included records Salaam Alykum-এর Tibetan Muslims topic-এর public article pages থেকে আসে। Raw MySQL backup, private user data, credentials এবং server secrets অন্তর্ভুক্ত নয়।

Official links

How to cite

আপনি যদি research, search evaluation, RAG experiments বা public-interest reporting-এ এই archive ব্যবহার করেন, repository release এবং original article URLs cite করুন।

Update frequency

Repository public pages থেকে batch-synced। প্রতিটি content batch-কে site lastmod, RSS/Atom update time, release version, dataset files, QA report এবং release notes একসাথে update করতে হবে।

License

Article bodies source-specific থাকে, কারণ অনেক post public internet material-এর translation বা repost। Repository scripts এবং generated metadata MIT notice-এর অধীনে দেওয়া হয় যেখানে maintainer-এর license দেওয়ার অধিকার আছে। LICENSE, SECURITY.md এবং metadata/source_policy.md দেখুন।

Article index

Full article index metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl এবং GitHub Pages-এ পাওয়া যায়। Original Chinese titles preserved থাকে যাতে প্রতিটি row public source page পর্যন্ত trace করা যায়।


Português

O que é este repositório?

Este repositório é a Base de Conhecimento dos Muçulmanos Tibetanos e Dataset RAG do Salaam Alykum. Ele converte a página pública de tópico https://salaamalykum.com/cn/topic/藏族穆斯林 em um arquivo compatível com GitHub, com Markdown para humanos, JSON/JSONL para máquinas, chunks RAG, metadados, notas de release, site estático GitHub Pages e Dataset Card pronto para Hugging Face.

O que é Salaamalykum.com?

Salaamalykum.com é uma plataforma de software construída por muçulmanos para contar suas histórias reais com suas próprias vozes e idiomas. Ela reúne notícias, artigos e informações de primeira mão sobre liberdade religiosa, vida islâmica, comunidades muçulmanas tibetanas e hui, direitos humanos, vida Halal e comunidades muçulmanas ao redor do mundo.

O que estamos fazendo agora?

Estamos preservando artigos públicos relacionados aos muçulmanos tibetanos em um formato durável de dupla trilha. O GitHub mantém o arquivo legível por humanos e a navegação do projeto; os arquivos prontos para Hugging Face mantêm a visão legível por máquinas para busca, RAG, indexação de citações e pesquisa responsável.

Quem somos?

Alhamdulillah, somos muçulmanos tentando construir software mais descentralizado, open-source e sem fins lucrativos para a comunidade muçulmana global, a Ummah. Queremos que o código, os metadados e a estrutura de conhecimento público permaneçam transparentes, reutilizáveis e seguros.

No que acreditamos?

Seguir Allah e fazer o bem. “Pelo Tempo. O ser humano está em perda. Exceto aqueles que creem, praticam boas obras, recomendam a verdade e recomendam a paciência.” (Quran 103)

Regras da comunidade

  • Nenhum conteúdo prejudicial aos usuários: sem promoção de crime, racismo, spam, mídia falsa, anúncios falsos ou manipulação abusiva.
  • Sem barreiras para cooperação útil: apoiamos o compartilhamento legal de conhecimento e a cooperação livre e respeitosa entre comunidades muçulmanas que falam idiomas diferentes.
  • Nenhum dado privado em arquivos públicos: dumps SQL brutos, senhas, tokens, cookies, sessões, logs de IP, tickets privados e tabelas de usuários são excluídos.

Idiomas do site

Foco nos direitos humanos muçulmanos atuais

Este arquivo foca em artigos públicos sobre identidade muçulmana tibetana, Tibete, Lhasa, Caxemira, Kalimpong e Nepal, liberdade religiosa, memória cultural, memória migratória, cidadania e educação, comunidades da diáspora e de refugiados, consumo ético, evidências públicas e a situação mais ampla dos direitos humanos dos muçulmanos. Compartilhar esses materiais não busca espalhar desespero; busca preservar testemunhos, lembrar a Ummah de paciência e unidade, e manter links de origem visíveis para pesquisadores e leitores.

Projeto do Alcorão em chinês

Salaam Alykum também mantém uma seção móvel do Alcorão em chinês com cinco traduções chinesas para comparação e reflexão. Busca móvel do Alcorão chinês: https://salaamalykum.com/cn/qurancn/mobile/

Por que isso é importante?

Quando a memória pública se fragmenta e plataformas online mudam rapidamente, um arquivo travado por release com hashes, URLs de origem, URLs canônicas, RSS, Atom, sitemap e llms.txt torna o material mais fácil de verificar, citar, rastrear e preservar. Este é um arquivo da web pública, não um vazamento de conteúdo de banco de dados privado.

Missão de software e declaração open source

  1. Totalmente open source: estrutura do repositório, metadados, relatórios QA e scripts são públicos para revisão.
  2. Preservação descentralizada: GitHub Pages, releases, Markdown e JSONL reduzem a dependência de uma única camada de apresentação.
  3. Sempre gratuito: o arquivo público pode ser lido sem pagamento.
  4. Puramente sem fins lucrativos: o objetivo é preservação, educação, pesquisa e serviço.

Valor do projeto e status de benchmark

Este repositório é uma implantação de dupla trilha. A trilha humana fornece arquivos Markdown normalizados e um site estático GitHub Pages. A trilha de máquina fornece JSON de artigos, JSONL, chunks RAG, índices de metadados, sitemap, RSS, Atom e Dataset Card pronto para Hugging Face. Status de benchmark: este é um arquivo público reprodutível para o tópico dos muçulmanos tibetanos do Salaam Alykum; ele não faz alegações de ranking não verificáveis.

Estatísticas e visão geral do dataset

Métrica Contagem / Detalhe
Total de artigos 74
Total de chunks RAG 74
Idioma Chinês simplificado (zh-Hans)
Tópico principal de origem Tibetan Muslims / 藏族穆斯林
Formato humano Markdown em content/
Formato de máquina JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Esquema de dados

Campo Tipo Descrição
article_id Integer ID público original do artigo.
title String Título original do artigo.
source_url String URL pública de origem.
canonical_url String URL canônica declarada pela página de origem.
author String Nome público do autor na página do artigo.
date_published String Timestamp de publicação.
date_modified String Timestamp de última modificação.
topic_tags List[String] Tags públicas do tópico.
content_sha256 String Hash SHA-256 para deduplicação e checagem de integridade.
content_markdown String Corpo do artigo normalizado em Markdown.
text String Texto do chunk RAG em data/rag_chunks.jsonl.

Registro RAG de exemplo e verdade do formato

O dataset nativo é um corpus de artigos e RAG. Ele não é um dataset conversacional nativo ShareGPT ou Alpaca. Ele pode ser transformado depois em exemplos de instruction-tuning somente se uma etapa de conversão separada e verdadeira for documentada.

Fonte dos dados

Todos os registros incluídos vêm de páginas públicas de artigos do Salaam Alykum sob o tópico dos muçulmanos tibetanos. O backup MySQL bruto, dados privados de usuários, credenciais e segredos do servidor não estão incluídos.

Links oficiais

Como citar

Se você usar este arquivo em pesquisa, avaliação de busca, experimentos RAG ou reportagem de interesse público, cite a release do repositório e as URLs originais dos artigos.

Frequência de atualização

O repositório é sincronizado em lotes a partir de páginas públicas. Cada lote de conteúdo deve atualizar ao mesmo tempo o lastmod do site, o horário de atualização RSS/Atom, a versão de release, os arquivos do dataset, o relatório QA e as notas de release.

Licença

Os corpos dos artigos permanecem source-specific porque muitas postagens são traduções ou republicações de material público da internet. Scripts do repositório e metadados gerados são oferecidos sob aviso MIT quando o mantenedor tem direitos para licenciá-los. Veja LICENSE, SECURITY.md e metadata/source_policy.md.

Índice de artigos

O índice completo está em metadata/site_index.csv, metadata/site_index.json, metadata/article_index.jsonl e no GitHub Pages. Os títulos originais em chinês são preservados para que cada linha possa ser rastreada até a página pública de origem.


اردو

یہ ریپازٹری کیا ہے؟

یہ ریپازٹری Salaam Alykum Tibetan Muslims Knowledge Base اور RAG Dataset ہے۔ یہ عوامی موضوعی صفحہ https://salaamalykum.com/cn/topic/藏族穆斯林 کو GitHub کے لیے موزوں archive میں بدلتی ہے، جس میں انسانوں کے لیے Markdown، مشینوں کے لیے JSON/JSONL، RAG chunks، metadata، release notes، static GitHub Pages site، اور Hugging Face-ready dataset card شامل ہیں۔

Salaamalykum.com کیا ہے؟

Salaamalykum.com مسلمانوں کا بنایا ہوا software platform ہے تاکہ وہ اپنی حقیقی کہانیاں اپنی آوازوں اور زبانوں میں بیان کر سکیں۔ یہ religious freedom، Islamic life، Tibetan Muslim اور Hui communities، human rights، Halal life، اور دنیا بھر کی Muslim communities کے بارے میں news، articles، اور first-hand information جمع کرتا ہے۔

ہم ابھی کیا کر رہے ہیں؟

ہم Tibetan Muslim سے متعلق public articles کو durable dual-track format میں محفوظ کر رہے ہیں۔ GitHub human-readable archive اور project navigation رکھتا ہے؛ Hugging Face-ready files search، RAG، citation indexing، اور responsible research کے لیے machine-readable view رکھتی ہیں۔

ہم کون ہیں؟

Alhamdulillah، ہم مسلمان ہیں اور global Muslim community یعنی Ummah کے لیے زیادہ decentralized، open-source، non-profit software بنانے کی کوشش کر رہے ہیں۔ ہم چاہتے ہیں کہ code، metadata، اور public knowledge structure شفاف، reusable، اور safe رہیں۔

ہم کیا مانتے ہیں؟

Allah کی پیروی کرو اور نیکی کرو۔ “زمانے کی قسم۔ انسان خسارے میں ہے۔ مگر وہ لوگ جو ایمان لائے، نیک عمل کیے، حق کی نصیحت کی، اور صبر کی نصیحت کی۔” (Quran 103)

Community rules

  • Users کے لیے harmful content نہیں: crime promotion، racism، spam، fake media، fake ads، یا abusive manipulation نہیں۔
  • Useful cooperation پر barriers نہیں: ہم مختلف زبانیں بولنے والی Muslim communities کے درمیان lawful knowledge sharing اور free, respectful cooperation کی حمایت کرتے ہیں۔
  • Public archives میں private data نہیں: raw SQL dumps، passwords، tokens، cookies، sessions، IP logs، private tickets، اور user tables شامل نہیں کیے گئے۔

Website languages

موجودہ Muslim human rights پر توجہ

یہ archive Tibetan Muslim identity، Khache communities، Tibet، Lhasa، Kashmir، Kalimpong، Nepal، migration memory، religious freedom، cultural continuity، education، citizenship، public evidence، اور Muslims کی وسیع human-rights situation سے متعلق public articles پر focus کرتا ہے۔ ان materials کو share کرنے کا مقصد ناامیدی پھیلانا نہیں؛ مقصد testimony کو محفوظ کرنا، Ummah کو patience اور unity یاد دلانا، اور researchers اور readers کے لیے source links کو visible رکھنا ہے۔

Chinese Quran project

Salaam Alykum پانچ Chinese translations کے ساتھ mobile-friendly Chinese Quran section بھی برقرار رکھتا ہے تاکہ comparison اور reflection ہو سکے۔ Chinese Quran mobile search: https://salaamalykum.com/cn/qurancn/mobile/

یہ کیوں اہم ہے؟

جب public memory ٹوٹ پھوٹ کا شکار ہو اور online platforms تیزی سے بدلیں، تو hashes، source URLs، canonical URLs، RSS، Atom، sitemap، اور llms.txt والا release-locked archive material کو verify، cite، crawl، اور preserve کرنا آسان بناتا ہے۔ یہ public-web archive ہے، private database content leak نہیں۔

Software mission اور open-source statement

  1. Completely open source: repository structure، metadata، QA reports، اور scripts review کے لیے public ہیں۔
  2. Decentralized preservation: GitHub Pages، releases، Markdown، اور JSONL ایک presentation layer پر dependence کم کرتے ہیں۔
  3. Always free: public archive بغیر payment پڑھا جا سکتا ہے۔
  4. Purely non-profit: مقصد preservation، education، research، اور service ہے۔

Project value اور benchmark status

یہ repository dual-track deployment ہے۔ Human-readable track normalized Markdown files اور static GitHub Pages site فراہم کرتا ہے۔ Machine-readable track article JSON، JSONL، RAG chunks، metadata indexes، sitemap، RSS، Atom، اور Hugging Face-ready dataset card فراہم کرتا ہے۔ Benchmark status: یہ Salaam Alykum Tibetan Muslims topic کے لیے reproducible public archive ہے؛ یہ unverifiable ranking claims نہیں کرتا۔

Dataset statistics اور overview

Metric Count / Detail
Total articles 22
Total RAG chunks 22
Language Simplified Chinese (zh-Hans)
Primary source topic Tibetan Muslims / 藏族穆斯林
Human format content/ میں Markdown
Machine format JSON, JSONL, CSV, RSS, Atom, sitemap
GitHub Pages https://salaamalykum.github.io/TibetanMuslims/
Release v2026.07.30-tibetan-muslims-topic-22

Data schema

Field Type Description
article_id Integer Original public article ID.
title String Original article title.
source_url String Public source URL.
canonical_url String Source page کا declared canonical URL.
author String Article page سے public author name.
date_published String Publication timestamp.
date_modified String Last modified timestamp.
topic_tags List[String] Public topic tags.
content_sha256 String Deduplication اور integrity checks کے لیے SHA-256 hash.
content_markdown String Normalized Markdown article body.
text String data/rag_chunks.jsonl میں RAG chunk text.

Sample RAG record اور format truth

Native dataset article اور RAG corpus ہے۔ یہ native ShareGPT یا Alpaca conversation dataset نہیں ہے۔ اسے instruction-tuning examples میں بعد میں صرف اس وقت بدلا جا سکتا ہے جب الگ اور truthful conversion step documented ہو۔

Data source

تمام included records Salaam Alykum کے Tibetan Muslims topic کے public article pages سے آتے ہیں۔ Raw MySQL backup، private user data، credentials، اور server secrets شامل نہیں ہیں۔

Official links

How to cite

اگر آپ اس archive کو research، search evaluation، RAG experiments، یا public-interest reporting میں استعمال کریں، تو repository release اور original article URLs cite کریں۔

Update frequency

Repository public pages سے batch-synced ہے۔ ہر content batch کو site lastmod، RSS/Atom update time، release version، dataset files، QA report، اور release notes ایک ساتھ update کرنے چاہئیں۔

License

Article bodies source-specific رہتے ہیں کیونکہ بہت سی posts public internet material کی translations یا reposts ہیں۔ Repository scripts اور generated metadata MIT notice کے تحت دیے جاتے ہیں جہاں maintainer کو انہیں license کرنے کا حق حاصل ہے۔ LICENSE، SECURITY.md، اور metadata/source_policy.md دیکھیں۔

Article index

Full article index metadata/site_index.csv، metadata/site_index.json، metadata/article_index.jsonl، اور GitHub Pages میں دستیاب ہے۔ Original Chinese titles محفوظ رکھے گئے ہیں تاکہ ہر row public source page تک trace ہو سکے۔

About

Salaam Alykum Tibetan Muslims topic public article archive and RAG dataset

Topics

Resources

Contributing

Security policy

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages