Token导航 LogoToken导航TokenDH.com
运维和基础设施需要联网github未标认证来源可访问许可证需确认审计通过

reinforcement-learning-supply-chain强化学习供应链

Agent Skill

reinforcement-learning-supply-chain 用于记录任务执行中的错误、用户纠正、经验和能力缺口,适合在 Codex、Claude、Cursor、Gemini CLI 中希望让 Agent 持续沉淀问题、修正和最佳实践时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

326

周安装

14

GitHub Stars

13

下载量

114
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:reinforcement-learning-supply-chain(强化学习供应链)
来源仓库:https://github.com/kishorkukreja/awesome-supply-chain
仓库路径:skills/reinforcement-learning-supply-chain
安装命令:
npx skills add https://github.com/kishorkukreja/awesome-supply-chain --skill reinforcement-learning-supply-chain
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/kishorkukreja/awesome-supply-chain --skill reinforcement-learning-supply-chain

简介

reinforcement-learning-supply-chain 用于记录任务执行中的错误、用户纠正、经验和能力缺口,适合在 Codex、Claude、Cursor、Gemini CLI 中希望让 Agent 持续沉淀问题、修正和最佳实践时使用。

  • 它能帮助 Agent 自动归档供应链相关异常、提炼优化策略,并在后续任务中提升交付稳定性。
  • 通过 npx skills add 命令从指定仓库安装,需结合原始 README 了解具体调用方式与参数说明。
  • 安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写操作。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

Reinforcement Learning for Supply Chain

You are an expert in applying reinforcement learning to supply chain sequential decision-making problems. Your goal is to help design, train, and deploy RL agents that learn optimal policies for inventory control, pricing, routing, and resource allocation through interaction with environments.

Initial Assessment

  1. Problem Type: Sequential decisions? (inventory orders, pricing adjustments, routing)
  2. State Space: What information available? (inventory levels, demand, prices)
  3. Action Space: What decisions? (order quantities, prices, routes)
  4. Reward Function: How measure performance? (profit, service level, cost)
  5. Environment: Simulator available or real system?

RL Fundamentals

Markov Decision Process (MDP):

  • States (S): system conditions
  • Actions (A): available decisions
  • Transitions (P): state dynamics
  • Rewards (R): immediate feedback
  • Policy (π): state → action mapping

Goal: Learn policy π that maximizes expected cumulative reward


Q-Learning for Inventory Control

import numpy as np
import matplotlib.pyplot as plt
from collections import defaultdict

class InventoryEnvironment:
    """
    Inventory control environment

    State: current inventory level
    Action: order quantity
    Reward: -holding_cost - backorder_cost + revenue
    """

    def __init__(self,
                 max_inventory=50,
                 holding_cost=1.0,
                 backorder_cost=10.0,
                 order_cost=2.0,
                 price=15.0):

        self.max_inventory = max_inventory
        self.h_cost = holding_cost
        self.b_cost = backorder_cost
        self.o_cost = order_cost
        self.price = price

        # Demand distribution (Poisson)
        self.mean_demand = 10

        self.state = 20  # Initial inventory

    def reset(self):
        """Reset environment"""
        self.state = 20
        return self.state

    def step(self, action):
        """
        Take action (order quantity), observe demand, get reward

        Returns: next_state, reward, done
        """

        # Order arrives
        inventory_after_order = min(self.state + action, self.max_inventory)

        # Demand occurs (stochastic)
        demand = np.random.poisson(self.mean_demand)

        # Satisfy demand
        sales = min(inventory_after_order, demand)
        backorder = max(0, demand - inventory_after_order)

        next_inventory = inventory_after_order - sales

        # Calculate reward
        revenue = self.price * sales
        holding = self.h_cost * next_inventory
        backorder_penalty = self.b_cost * backorder
        ordering = self.o_cost * action

        reward = revenue - holding - backorder_penalty - ordering

        self.state = next_inventory
        done = False

        return next_inventory, reward, done

class QLearningAgent:
    """
    Q-Learning agent for inventory control
    """

    def __init__(self,
                 state_space,
                 action_space,
                 learning_rate=0.1,
                 discount_factor=0.95,
                 epsilon=0.1):

        self.states = state_space
        self.actions = action_space
        self.lr = learning_rate
        self.gamma = discount_factor
        self.epsilon = epsilon

        # Q-table: Q(s, a)
        self.Q = defaultdict(lambda: defaultdict(float))

    def select_action(self, state):
        """
        Epsilon-greedy action selection
        """

        if np.random.random() < self.epsilon:
            # Explore: random action
            return np.random.choice(self.actions)
        else:
            # Exploit: best action
            q_values = [self.Q[state][a] for a in self.actions]
            best_action = self.actions[np.argmax(q_values)]
            return best_action

    def update(self, state, action, reward, next_state):
        """
        Q-learning update rule

        Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)]
        """

        # Current Q-value
        current_q = self.Q[state][action]

        # Best Q-value for next state
        next_q_values = [self.Q[next_state][a] for a in self.actions]
        max_next_q = max(next_q_values)

        # TD target
        target = reward + self.gamma * max_next_q

        # Update
        self.Q[state][action] = current_q + self.lr * (target - current_q)

    def get_policy(self):
        """Extract greedy policy from Q-values"""

        policy = {}
        for state in self.states:
            q_values = [self.Q[state][a] for a in self.actions]
            best_action = self.actions[np.argmax(q_values)]
            policy[state] = best_action

        return policy

# Training
env = InventoryEnvironment()
agent = QLearningAgent(
    state_space=list(range(51)),
    action_space=list(range(21)),  # Order 0-20 units
    learning_rate=0.1,
    discount_factor=0.95,
    epsilon=0.1
)

n_episodes = 10000
episode_rewards = []

for episode in range(n_episodes):
    state = env.reset()
    total_reward = 0

    for t in range(30):  # 30-day horizon
        action = agent.select_action(state)
        next_state, reward, done = env.step(action)

        agent.update(state, action, reward, next_state)

        total_reward += reward
        state = next_state

        if done:
            break

    episode_rewards.append(total_reward)

    if (episode + 1) % 1000 == 0:
        avg_reward = np.mean(episode_rewards[-100:])
        print(f"Episode {episode+1}: Avg Reward = {avg_reward:.2f}")

# Extract learned policy
policy = agent.get_policy()

print("\nLearned Policy (Inventory → Order Quantity):")
for inventory in range(0, 51, 5):
    order = policy.get(inventory, 0)
    print(f"  Inventory {inventory}: Order {order}")

Deep Q-Network (DQN) for Complex States

import torch
import torch.nn as nn
import torch.optim as optim
import numpy as np
from collections import deque
import random

class DQN(nn.Module):
    """
    Deep Q-Network
    """

    def __init__(self, state_dim, action_dim, hidden_dim=128):
        super(DQN, self).__init__()

        self.network = nn.Sequential(
            nn.Linear(state_dim, hidden_dim),
            nn.ReLU(),
            nn.Linear(hidden_dim, hidden_dim),
            nn.ReLU(),
            nn.Linear(hidden_dim, action_dim)
        )

    def forward(self, state):
        return self.network(state)

class DQNAgent:
    """
    DQN Agent with Experience Replay and Target Network
    """

    def __init__(self, state_dim, action_dim, lr=0.001, gamma=0.99):

        self.state_dim = state_dim
        self.action_dim = action_dim
        self.gamma = gamma

        # Main network
        self.q_network = DQN(state_dim, action_dim)

        # Target network
        self.target_network = DQN(state_dim, action_dim)
        self.target_network.load_state_dict(self.q_network.state_dict())

        self.optimizer = optim.Adam(self.q_network.parameters(), lr=lr)
        self.loss_fn = nn.MSELoss()

        # Experience replay buffer
        self.memory = deque(maxlen=10000)
        self.batch_size = 64

    def select_action(self, state, epsilon=0.1):
        """Epsilon-greedy action selection"""

        if random.random() < epsilon:
            return random.randint(0, self.action_dim - 1)

        with torch.no_grad():
            state_tensor = torch.FloatTensor(state).unsqueeze(0)
            q_values = self.q_network(state_tensor)
            return q_values.argmax().item()

    def store_transition(self, state, action, reward, next_state, done):
        """Store experience in replay buffer"""
        self.memory.append((state, action, reward, next_state, done))

    def train(self):
        """Train on mini-batch from replay buffer"""

        if len(self.memory) < self.batch_size:
            return

        # Sample mini-batch
        batch = random.sample(self.memory, self.batch_size)

        states = torch.FloatTensor([t[0] for t in batch])
        actions = torch.LongTensor([t[1] for t in batch])
        rewards = torch.FloatTensor([t[2] for t in batch])
        next_states = torch.FloatTensor([t[3] for t in batch])
        dones = torch.FloatTensor([t[4] for t in batch])

        # Current Q-values
        q_values = self.q_network(states).gather(1, actions.unsqueeze(1))

        # Target Q-values
        with torch.no_grad():
            next_q_values = self.target_network(next_states).max(1)[0]
            targets = rewards + self.gamma * next_q_values * (1 - dones)

        # Loss and update
        loss = self.loss_fn(q_values.squeeze(), targets)

        self.optimizer.zero_grad()
        loss.backward()
        self.optimizer.step()

    def update_target_network(self):
        """Copy weights from main network to target network"""
        self.target_network.load_state_dict(self.q_network.state_dict())

Policy Gradient for Continuous Actions

class PolicyNetwork(nn.Module):
    """
    Policy network for continuous actions
    """

    def __init__(self, state_dim, action_dim, hidden_dim=128):
        super(PolicyNetwork, self).__init__()

        self.network = nn.Sequential(
            nn.Linear(state_dim, hidden_dim),
            nn.Tanh(),
            nn.Linear(hidden_dim, hidden_dim),
            nn.Tanh()
        )

        # Mean and std for Gaussian policy
        self.mean_layer = nn.Linear(hidden_dim, action_dim)
        self.log_std_layer = nn.Linear(hidden_dim, action_dim)

    def forward(self, state):
        features = self.network(state)
        mean = self.mean_layer(features)
        log_std = self.log_std_layer(features)
        std = torch.exp(log_std)

        return mean, std

class PolicyGradientAgent:
    """
    REINFORCE algorithm for policy gradient
    """

    def __init__(self, state_dim, action_dim, lr=0.001, gamma=0.99):

        self.policy = PolicyNetwork(state_dim, action_dim)
        self.optimizer = optim.Adam(self.policy.parameters(), lr=lr)
        self.gamma = gamma

        self.saved_log_probs = []
        self.rewards = []

    def select_action(self, state):
        """Sample action from policy"""

        state_tensor = torch.FloatTensor(state).unsqueeze(0)
        mean, std = self.policy(state_tensor)

        # Sample from Gaussian
        dist = torch.distributions.Normal(mean, std)
        action = dist.sample()
        log_prob = dist.log_prob(action).sum()

        self.saved_log_probs.append(log_prob)

        return action.numpy()[0]

    def update(self):
        """Update policy using REINFORCE"""

        # Calculate returns
        returns = []
        R = 0

        for r in reversed(self.rewards):
            R = r + self.gamma * R
            returns.insert(0, R)

        returns = torch.tensor(returns)
        returns = (returns - returns.mean()) / (returns.std() + 1e-9)

        # Policy gradient
        policy_loss = []
        for log_prob, R in zip(self.saved_log_probs, returns):
            policy_loss.append(-log_prob * R)

        policy_loss = torch.stack(policy_loss).sum()

        # Update
        self.optimizer.zero_grad()
        policy_loss.backward()
        self.optimizer.step()

        # Clear buffers
        self.saved_log_probs = []
        self.rewards = []

Applications

1. Dynamic Pricing

# State: inventory, time, competitor prices, demand signals
# Action: price adjustment
# Reward: revenue - costs

2. Warehouse Robot Control

# State: robot position, item locations, orders
# Action: movement and pick decisions
# Reward: -time - collisions + items picked

3. Supply Chain Network Optimization

# State: inventory at all nodes, pipeline inventory, demand
# Action: shipment quantities between nodes
# Reward: -costs + service level bonuses

4. Order Fulfillment

# State: orders, inventory, capacity, time
# Action: order-to-warehouse assignment
# Reward: -shipping cost - delay penalties

Tools & Libraries

Python RL:

  • stable-baselines3: RL algorithms
  • Ray RLlib: Distributed RL
  • TensorFlow Agents: TF-based RL
  • PyTorch: Custom implementations

Simulation:

  • SimPy: Discrete-event simulation
  • Gym: RL environments
  • Custom simulators

Related Skills

  • optimization-modeling: traditional optimization
  • optimization-ml-hybrid: RL + optimization
  • **dynamic-pricing`: pricing applications
  • inventory-optimization: inventory control
  • **route-optimization`: VRP with RL

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.32%
按下载量换算40

Claude

33.9%
按下载量换算39

Cursor

17.82%
按下载量换算20

Gemini CLI

9.22%
按下载量换算11

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills