这次做文档站,不是为了把 Markdown 换个皮肤。
真正的问题是:接口文档已经散落在很多地方了。
有些在 README 里,有些在接口定义里,有些在 Swagger JSON 里,有些在聊天记录和联调说明里。短期看都能用,长期看就会变成一个很典型的问题:
12345前端问接口怎么调;后端说看 Swagger;测试说字段含义不清楚;设备端说流程文档找不到;后来的人不知道哪份才是最新的。
...
如果你第一次听到“微内核架构”,可以先把它理解成一句话:
1核心系统只保留最稳定、最通用的能力,具体业务能力都通过插件接进来。
这和我们平时用的很多软件很像。
浏览器本身只提供浏览网页、管理标签页、运行扩展的基础能力。广告拦截、翻译、密码管理、截图工具,都是扩展插件提供的。
VS Code 本身是一个编辑器内核。Python、Go、Java、Markdown、GitLens、Docker、...
最近整理了一个 mini_nocobase_learning_demo,它不是 NocoBase 的源码复刻,而是用 Python 标准库写出来的一个学习版微内核。项目规模很小,但把无代码平台里最关键的几件事串起来了:动态表、Resource Action、权限、UI Schema、工作流、审批、图表、文件和导入导出。
这类 demo 的价值不在于“又写了一套 CRUD”,而在于它能帮助我们...
FastAPI Template 是一个企业后台 API 模板,内置 JWT 登录、RBAC、用户/角色/菜单、文件、审计日志、Docker、CI、Redis、任务队列和可观测性。
如果你正准备起一个 FastAPI 管理后台,或者不想每个项目都重复搭一遍权限、审计、缓存和 worker,可以先看一眼这个仓库。觉得省事的话,顺手点个 Star 就行。
这次改动从 Re...
之前陆续写过 Normalization 的对比、RL 基础,但一直没整理一份 LLM 架构的完整笔记。每次看 LLaMA、Qwen、DeepSeek 的源码,都在脑子里重新过一遍同样的东西,不如一次性写清楚。
这篇覆盖:整体架构 → RMSNorm → 自注意力 + GQA → Causal Mask → Flash Attention → Paged Attention → RoPE →...
做 MiniCode 这个项目的起因很简单:我想真正搞懂 Claude Code 是怎么工作的。
读源码没有,代码不开源。看教程,全是 Python + LangChain 的 Hello World,看完还是不知道一个真实的编程助手内部长什么样。所以就自己写了一个——MiniCode,用 Go,3000+ 行,能用。
这篇文章不是文档,是记录几个做的时候觉得有意思的设计决策。
工具系统:...
原文地址:https://www.rasior.com/2025/12/28/rl-algorithms-unified-framework/
我学强化学习的时候,最大的困扰是:算法太多,名字一堆,每次看完一个新算法就忘了之前的,总觉得它们之间没什么联系。
MC、TD、SARSA、Q-learning、DQN、REINFORCE、PPO、SAC、TD3……这些名字听起来像是完全不同的东西...
问题是怎么被发现的设备端同学有天跟我说:你们服务端是不是有 bug?用户退出直播的时候,设备会”突然收到一堆消息”。
我第一反应是不信。我们有分布式锁保护啊,怎么可能重复下发呢?
但日志不会骗人:
123session_id 3be9548d... 连续 5 次 stopsession_id 196e214b... 连续 7 次 stopsession_id 2baf317e... 连续 5...
训练神经网络的时候,Normalization 几乎是标配。但 BatchNorm、LayerNorm、RMSNorm 这些东西,我之前一直没彻底搞明白它们的区别。公式都差不多,都是减均值除标准差,那到底差在哪?
这篇把它们放一起对比一下,顺便理一理各自适用的场景。
先从最基础的问题开始:为什么要 Normalize?神经网络训练时有个烦人的问题:每一层的输入分布会随着前面层参数的更新而变化...
符号表先把常用符号列出来,后面用到可以回来查。
基本元素
符号
含义
说明
状态
是当前状态, 是下一个状态
状态空间
所有可能状态的集合
动作
智能体采取的行动
动作空间
所有可能动作的集合
奖励
单步获得的即时奖励
或
奖励函数
在状态 (执行动作 )获得的奖励
折扣因子
,越小越短视
时间步
离散时间索引
概率与策略
符...