Skip to content

helloworld-x3/LocalPipe

Repository files navigation

LocalPipe — AI 创意本地化流水线

输入一版中国创意,输出多个国家"接地气"的本地版本——不只是翻译,连语气、梗、审美都做本地适配。

Hello World 团队 · 2026 AI先锋未来人才大赛 · 易点天下命题

核心思路

现有 AI 本地化工具(翻译/配音/字幕流水线)解决了"快"和"多",但只做形式转换——同一条创意换个语言铺多国,本质是一稿多投。本项目定位在创译(Transcreation)层:先拆解创意内核,再基于国家文化画像重新创作,让产出"像当地人写的"。

学术依据:GPT-4o 广告转译对照实验中,带文化上下文的 Prompt 在 20 条中的 17 条上优于裸 Prompt(Unbabel, MT Summit 2025);四个前沿 LLM 在跨文化创译基准上无一超过 75/100 分(Kocaman, Kenyon College 2025)——裸模型搞不定文化共鸣,需要结构化文化上下文与验证机制。完整调研(行业现状/竞品扫描/开源同类项目/五篇学术文献)见 docs/research-review.md,验证方案见 docs/experiment-design.md

架构

中文创意
   ↓
[1] 创意解构层    LLM 拆解:卖点 / 情绪钩子 / 文化梗 / 人群 / CTA
   ↓
[2] 重创作层      "本地创意人" Agent × 国家文化画像 × 品牌规则
   │              产出:本地语文案 + 中文回译 + 适配说明 + 画像引用清单
   ↓
[3] 保真回检层    产出反向解构 ↔ 源要素逐项比对(闭环)
   │              要素回收率 < 70% 自动打回重做,附丢失要素提示
   ↓
[4] 禁忌质检层    画像禁忌条目逐条审查 + 清单外风险扫描
   ↓
交付              结构化 JSON,final_status: pass / needs_review

设计决策(为什么这么做)

机制 解决什么问题
画像条目元数据化(置信度/时效/来源/ID) 流行梗三个月一换,禁忌基本永久——时效字段让过期梗自动退场;置信度决定人工校准优先级
画像引用追溯(used_entries) 产出被评"不地道"时,直接定位到具体画像条目,归因从猜变成查
保真闭环回检 重创作最大的风险是为了本地化把卖点弄丢——管线自检,不达标不出厂
品牌术语锁定(brand_context) 防止品牌名被"本地化"、数字卖点被改写(参考 Brand-Loom 的 brand_context 设计与 Tower of Babel 的术语锁定模式)
A/B 对照基线(baseline.py) 不假设方案有效:裸 Prompt 对照组 + 母语者盲测验证管线增益
四层安全防线(输入/传输/响应/数据) Prompt 注入防御 + 令牌桶速率限制 + JSON Schema 响应校验 + 画像文件 SHA256 验签——管线在设计阶段就将安全视为基础设施而非后装补丁

快速开始

pip install -r requirements.txt
cp .env.example .env   # 填入你的 LLM API Key(默认 DeepSeek,兼容 OpenAI 接口)

python pipeline.py     # 单条演示:中文创意 → 泰国版
python baseline.py     # A组对照:裸Prompt直出
python batch.py examples/creatives.json th   # 批量 + 生成盲测集

真实产出示例(同一条创意 × 两个市场)

输入(含4处中文网络梗):

这个夏天,别让手机先中暑!CoolClip散热背夹,3秒降温15度,开黑五连坐照样稳如老狗。学生党福音,一杯奶茶钱,游戏体验直接起飞。

泰国版examples/thailand_demo.json,final_status: pass):

  • "开黑"→ RoV(泰国国民手游),"稳如老狗"未直译(泰语直译冒犯)转为"五人连坐不卡顿"
  • 自动加入 COD 货到付款(泰国主流支付习惯,画像条目 th-006)与 TikTok 风格标签(th-007)
  • 品牌名 CoolClip 与数字卖点"3秒降温15度"经术语锁定原样保留
  • 保真回检:5 项源要素 + 2 项保护术语全部通过,回收率 100%

日本版examples/japan_demo.json,final_status: needs_review——质检层真的拦了东西):

  • "一杯奶茶钱"→ コンビニのアイスより安い(便利店冰淇淋价格锚点),"开黑"→ APEX/原神五排场景,融入 推し活/タイパ 流行词与拟声词(ひんやり)
  • 保真回检 100%,但禁忌质检标出 3 处 medium 风险:「安い」单独作卖点未绑品质证据、「最高/絶対」式表述涉嫌夸大断言(均触景品表示法,画像条目 jp-001/jp-002),以及清单外扫描发现的游戏名版权风险
  • 这正是管线的价值:不合规的产出不会带着 pass 出厂,人工只需终审被标记的条目

跨品类验证examples/thailand_demo_c02.json,美妆类):

  • C02 口红文案("早八人""纯欲天花板""气场两米八"),首轮解构后重创作品质不达回收率仅 62%,低于 70% 阈值触发保真闭环自动打回重做
  • 重做后回收率 100% 通过——保真闭环不是针对 3C 品类单独调优的,跨品类仍然有效,且打回重做机制真的会触发

文件结构

pipeline.py            四层管线主体
baseline.py            A组对照(裸Prompt)
batch.py               批量模式:多创意×多市场,输出盲测集+揭盲表
model.py               LLM 抽象层(OpenAI 兼容,多厂家切换)
profiles/              国家文化画像库(泰/日/美,带元数据,日美为冷启动版待盲测校准)
docs/                  调研综述(行业/竞品/开源/学术)+ 对照实验设计
examples/              品牌上下文示例 / 源创意样本 / 泰日两市场真实产出存档
outputs/               批量产出(git 忽略)

路线图

  • 四层管线 MVP(解构/重创作/保真闭环/禁忌质检)
  • 画像元数据化 + 引用追溯 + 品牌术语锁定
  • A/B 对照组生成 + 盲测集混排
  • 泰/日/美三市场画像 v0.1(日美为冷启动版)
  • 母语者盲测执行(泰/日/美 3 市场,判定标准已前置锁定,见 docs/experiment-design.md)
  • 评分回灌:盲测数据按维度归因到画像/Prompt/规则库
  • 飞书多维表格交付层 + 批量并发
  • 模型路由(按市场×内容类型挂载基座模型,依据 EC Innovations 2026 基准)

团队

Hello World(x³):乔唯一(技术/管线)· 唐启程(跨境电商业务/海外盲测渠道)· 孙文洁(文化画像/评分标准)

About

AI creative localization pipeline: deconstruct → culture-profile transcreation → fidelity loop → taboo check. 不只是翻译,是创意的跨文化重创作。

Topics

Resources

License

Stars

2 stars

Watchers

0 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors

Languages