| Chủ Nhật · 24 tháng 5, 2026 |
Issue № 006 |
15 phút đọc |
|
|
Bản tin tuần FindSkill
The Skill
Dành riêng cho thành viên FindSkill Pro. Những tin AI mới nhất, thật sự hữu ích cho công việc của bạn.
|
|
Chỉ dành cho thành viên Pro
|
Bản tin riêng tư
|
Không đăng tải ở đâu khác
|
|
|
|
Mia
Biên tập viên học AI · FindSkill.ai
|
Chào bạn, Issue 006 đến đây nhé. Tuần này là Tuần Phật Đản — mình giữ thư gọn hơn thường lệ, chọn lọc kỹ ba câu chuyện đáng đọc nhất tuần.
Mình là Mia. Mỗi thứ Hai mình gửi bạn một bản brief về tin AI trong tuần — không jargon, không hype, không cái kiểu "10 thứ bạn BẮT BUỘC phải biết". Chỉ thành viên Pro thôi, không đăng ở đâu khác.
Thứ Ba tuần này Google ship trọn stack agent tại I/O. Chủ Nhật trước đó, Anthropic mua công ty đã viết SDK cho mọi lab lớn. Hai vụ này ồn ào, sẽ phủ kín báo tech thêm nửa tháng nữa. Mà câu chuyện âm thầm hơn nằm bên dưới mới là cái mình muốn dành phần lớn issue cho. Vendor đang bắt đầu ship eval như một sản phẩm: họ công bố benchmark, rồi bán dịch vụ tư vấn giúp bạn đạt benchmark đó. OpenAI làm hai lần trong tháng. Anthropic làm với Outcomes. HubSpot làm với AEO Sensor. Pattern này là hình dáng mới của AI go-to-market, và nó đổi cả công việc bạn sẽ làm quý sau.
Trả lời nhanh. Câu hỏi tuần trước — deliverable hằng tuần nào bạn dựng writer-critic loop trước — nhận 31 reply. Top ba: weekly status gửi khách (15), thư từ chối ứng viên (7), update gửi board (5). Mình đang viết rubric riêng theo role cho batch đầu tuần này, sẽ gửi cho mọi bạn đã reply. Bạn cứ reply nếu muốn vào batch sau.
— Mia
|
01 |
Tin AI tuần này
Ba câu chuyện đáng để mắt tới tuần này
|
Tool Launch
Google ship trọn stack agent tại I/O. Cuộc đua runtime vừa từ ba thành bốn.
Ngày 19/5 tại Google I/O, Google tung hai thứ trong cùng một keynote. Gemini Spark là phần consumer — một personal agent 24/7 trong app Gemini, đặt bàn hộ bạn, dựng giỏ hàng, edit ảnh thay bạn. Spark ship với đúng ba MCP connector ngày-đầu-tiên: Canva, OpenTable, Instacart. Mà ở Việt Nam mình, chỉ Canva là dùng được nhé. OpenTable không có thị trường VN — bạn đang dùng PasGo, TableNow để đặt bàn nhà hàng. Instacart cũng không có — bạn đi chợ qua GrabMart, Be Food, ShopeeFood. Nên trên thực tế, Spark ngày-đầu chỉ có 1/3 connector chạm tới đời sống mình. Antigravity 2.0 là phần dev — một desktop app, CLI, SDK, và Managed Agents trong Gemini API, tất cả xây quanh chuyện chạy nhiều agent song song. TechCrunch gọi đây là câu trả lời thật đầu tiên của Google cho Claude Code và Cursor. Google ship kèm gói AI Ultra 100 USD/tháng (khoảng 2,5 triệu VND), gấp 5 lần usage limit Antigravity so với gói Pro. Bài Gemini Spark MCP connector roadmap bên mình đăng tối thứ Bảy đi qua đúng khoảng trống này và dựng decision tree cho PM SaaS.
|
Điều này có nghĩa gì với bạn
Thị trường runtime agent vừa thành cuộc đua bốn ngựa. Claude, ChatGPT, Cursor, và giờ Gemini đều có stack parallel-agent đã ship cho user thật. Bạn không cần chọn ngay tuần này đâu. Mà bạn cần biết trong bốn cái đó, bạn dùng cái nào cho loại việc nào — tốt nhất là viết được một câu cho mỗi cái, vì sếp bạn sẽ hỏi câu đó trong tháng tới. Bỏ mười phút thử Antigravity 2.0 trên một task thật tuần này. Kể cả không bao giờ dùng lại, bạn vẫn có câu trả lời cụ thể khi ai hỏi nó so với mấy cái kia thế nào.
|
Business
Anthropic mua công ty đã viết SDK cho mọi lab lớn. Layer infra vừa gom lại.
Ngày 18/5, Anthropic mua Stainless với giá trên 300 triệu USD. Stainless là startup bốn năm tuổi chuyên biến API spec thành SDK chuẩn mực trong bảy ngôn ngữ — và họ xây SDK chính chủ cho OpenAI, Google, Cloudflare, Cerebras, Perplexity, và cả Anthropic. TechCrunch xác nhận các sản phẩm hosted sẽ đóng cho khách không phải Anthropic. SDK đang dùng vẫn chạy; pipeline auto-maintenance giữ chúng đồng bộ với thay đổi API thì không. Thread Hacker News đạt 527 điểm và chia khoảng 60/40 — bên ồn hơn gọi đây là "vũ khí hoá supply chain", bên im hơn chỉ ra rằng acquihire nhân tài mới là kèo thật. Cả hai cách đọc đều đúng. Speakeasy và FERN đăng offer migration công khai cho cựu khách Stainless trong vòng 48 tiếng.
|
Điều này có nghĩa gì với bạn
Kể cả khi bạn không ship SDK, chuyện này vẫn liên quan đấy. Bài học là cái audit dependency-graph mà thread X của @aakashgupta gợi ra: trong stack bạn còn chỗ nào nữa một công ty đang nắm hạ tầng bạn phụ thuộc, và kế hoạch của bạn là gì nếu họ đổi hướng? Nếu công ty bạn xài Base.vn (FPT mua 2021, 50+ ứng dụng), MISA AMIS OneAI, hay 1Office — cả ba đều có dependency gián tiếp lên SDK do Stainless dựng. Ở mình hay nói "đừng đặt trứng vào một giỏ", còn ngôn ngữ chính phủ trong Chiến lược AI 2030 gọi là "chống lệ thuộc một nhà cung cấp". Bản chất giống nhau. Stainless là ví dụ nhìn thấy được. Bài học chung là biết vendor AI nào đang nắm nhiều layer dưới chân họ hơn quý trước, và chi phí chuyển đổi của bạn là bao nhiêu nếu họ siết. Sáu mươi phút với `package.json` hoặc `requirements.txt` của bạn — đó là cuộc audit.
|
Trend đáng theo dõi
Vendor giờ công bố benchmark và bán dịch vụ giúp đạt benchmark đó. Eval đang thành sản phẩm.
Ba điểm dữ liệu trong tháng này, không cái nào là trùng hợp. Ngày 6/5, OpenAI công bố B2B Signals — báo cáo mà số 3,5× và 16× của "frontier firm" đã nằm trên slide deck của mọi CTO quý này. Bốn ngày sau, ngày 10/5, OpenAI tung Deployment Company, một nhánh tư vấn mà pitch deck của họ phụ thuộc vào việc doanh nghiệp cảm thấy mình đang tụt lại đằng sau cái chart mà chính OpenAI vừa công bố. Anthropic chơi đúng nước cờ song song: họ ship Outcomes vào public beta cùng ngày 6/5, tính năng cho dev chấm output agent theo rubric custom, công bố mức cải thiện 10 điểm trên task success ngay khi mở hộp. Họ cũng đăng case study. HubSpot tung AEO Sensor ngày 14/5 — dashboard miễn phí theo dõi citation AI-search — và HubSpot cũng bán dịch vụ AEO giúp bạn sửa cái dashboard chỉ ra. Ba công ty, ba tuần, cùng một hình dáng. Benchmark chính là phễu lead cho dịch vụ tư vấn. Ở Việt Nam mình, Zalo AI đã xây VMLU — bộ benchmark đánh giá năng lực LLM tiếng Việt, đã chạy 3.729 lần đánh giá tính đến hết 2024. Đó là MMLU phiên bản Việt — vẫn là benchmark của lab, mà cho mình biết "đánh giá AI là gì" nhìn từ góc Việt Nam.
|
Điều này có nghĩa gì với bạn
Đây là lens để đọc mọi announcement vendor trong hai quý tới. Khi ai đó công bố benchmark, hỏi luôn họ bán gì cho công ty bị chấm điểm thấp trên benchmark đó. Thông tin vẫn có ích — B2B Signals là thật, mức lift 10 điểm của Outcomes là thật, citation của AEO Sensor là thật — mà không trung lập, và phần footnote trên slide gửi sếp là bắt buộc, không phải tuỳ chọn. Phiên bản nội bộ của cú chuyển này quan trọng hơn phiên bản vendor nhiều. Lợi thế cạnh tranh của team bạn năm sau sẽ thuộc về ai dựng rubric nội bộ trước. Mục 03 là role mà chuyện này biến thành; Mục 04 là bước khởi động nhỏ nhất có thể.
---
|
|
02 |
Thuật ngữ của tuần
Một khái niệm để hiểu trong tuần này
|
| |
|
Thuật ngữ №006
Evals
< evaluations (còn gọi eval harness, eval suite — báo Việt dùng "đánh giá AI" hoặc "bộ kiểm thử AI") >
Một eval là bài test lặp lại được, chấm output AI theo rubric. Bạn định nghĩa "tốt" trông thế nào trong 5–8 dòng, gom một tập input cố định bạn quan tâm (một "golden set" 20–50 ví dụ), chạy AI qua từng cái, rồi chấm output theo rubric. Chạy hằng tuần là bạn biết AI đang tốt hơn, tệ đi, hay trôi.
|
Think of it like this →
Một thầy giáo viết rubric chấm văn trước khi phát đề. Rubric chính là eval ("Luận điểm có ở đoạn đầu không? Có / Không. Dẫn chứng có ghi nguồn không? Có / Không."). Chồng 30 bài luận là golden set của bạn. Chấm cùng cách mỗi tuần là cái cho bạn biết lớp đang giỏi lên — không phải cảm giác của bạn về bài cuối cùng vừa chấm.
|
|
⚠ Common misconception
"Eval là cho lab AI benchmark model mới — không phải cho người như mình." Không phải vậy đâu. MMLU và SWE-bench leaderboard chỉ là một góc nhỏ xíu của ngành. Eval quan trọng với công việc bạn là eval nội bộ: năm dòng cụ thể chấm output AI bạn phụ thuộc mỗi tuần. Lab dùng rubric vì rubric hiệu quả; cùng logic đó áp được cho marketer chấm draft email hay paralegal chấm memo nghiên cứu. Thiết kế rubric là kỹ năng, và nó co được về một task đơn lẻ lặp đi lặp lại.
|
Bạn sẽ gặp nó ở đâu: Anthropic Outcomes (chấm rubric ngay tại inference, 6/5). OpenAI Evals platform (và PromptFoo, OpenAI mua trong tháng 3 — vẫn MIT-licensed). Braintrust — platform observability eval-first vừa gọi 80 triệu USD Series B trong tháng 2. Inspect AI — framework eval mã nguồn mở của chính phủ Anh, giờ Anthropic và DeepMind dùng để đánh giá frontier-safety. Ở Việt Nam mình: VMLU của Zalo AI và JAIST, đã chạy 3.729 lần đánh giá LLM. Và mọi cuộc họp hằng tuần ai đó thốt "AI ngày trước giỏi cái này mà giờ không nữa" — ý họ là bọn mình không có eval, nên phát hiện ra muộn quá.
Evaluating AI Models — course thực hành →
|
|
03 |
Phân tích sâu
Role chưa ai tuyển — và là role nghề bạn sẽ map vào tiếp theo
|
Một job title vừa xuất hiện trên ZipRecruiter và Indeed trong 90 ngày qua mà gần như không ai trong team bạn có trong CV. Hai trong số posting mình đọc khi viết bài này trả trên 130 USD/giờ — khoảng 3 triệu VND/giờ, gấp 3–5 lần lương freelance VN hiện tại, gấp đôi senior AI Engineer ở Hà Nội (khoảng 54.000 USD/năm theo Glassdoor). Role này tồn tại vì cú chuyển ở Story 3 Mục 01 — và bạn định vị được mà không cần đổi việc.
Lần đầu mình thấy posting senior "AI Evaluation Engineer" với mức trần 400.000 USD mình tưởng đó là ngoại lệ. Không phải đâu. Search ZipRecruiter hay Indeed hôm nay, listing "AI Evaluator" trải hết trang đầu, từ 43 đến 153 USD/giờ cho bản engineering, và 65K USD trung bình cho bản generalist. Một title khác mới hơn — "Agent Task Evaluator" — trả 80–130 USD/giờ tính đến tháng 5/2026. Ở Việt Nam thì sao: TopCV có 104 vị trí "AI Engineer" tính tới 22/5/2026, ITviec có 166 vị trí, mà chưa thấy "AI Evaluator" tách riêng. Nghĩa là người đầu tiên ở công ty bạn nhận role này sẽ là người tự định nghĩa nó. Cái nghẽn không phải bằng cấp khoa học máy tính. Cái nghẽn là phán đoán rubric. Đó là tin vui, vì phán đoán rubric chủ yếu là kỹ năng mang theo được, lớn dần khi thực hành, không phải tấm bằng buộc bạn quay lại trường học.
The role. Cứ gọi là AI evaluator — người trong team có công việc là biết xem output AI có thực sự tốt không. Họ không viết prompt (giờ ai cũng làm). Họ không train model (lab làm rồi). Họ dựng rubric, chạy hằng tuần trên tập ví dụ cố định, audit mẫu nào rubric ở ranh giới, rồi nói với team "cái này đủ ngon để ship" hoặc "chưa đủ, và đây là tiêu chí nào fail". Kết luận của B2B Signals về frontier firm — rằng 64% gap năng suất là chiều sâu, không phải khối lượng — chính là toán học chống chân của role này. Một team chạy hàng nghìn workflow agentic mỗi tuần thì không thể biết cái nào đang chạy ngon nếu không có ai cầm chính việc đó.
The skill stack. Bốn kỹ năng, theo thứ tự mức trả lại. Một — thiết kế rubric. Biến cái "đẹp/xấu mơ hồ" thành 5–8 dòng cụ thể, mỗi dòng là câu hỏi có/không mà người lạ chấm cũng cho ra kết quả giống bạn. ("Có gọi tên deadline" hơn "rõ ràng".) Hai — chọn golden set. Pick 20–50 input đại diện phổ trải của ca thật. Ví dụ chán, edge case lạ, cái đã vỡ quý trước. Ba — chấm có hiệu chỉnh. Biết khi nào LLM-as-judge dùng được (tiêu chí khách quan, ít rủi ro) và khi nào chỉ con người mới bắt được lỗi (tone, phán đoán, bất cứ thứ gì bị quản lý). Bốn — eval ops. Chạy harness cùng nhịp mỗi tuần. Theo dõi drift. Cho rubric về hưu khi nó không bắt được gì mới và viết cái mới. Một nửa là phán đoán biên tập; nửa kia là kỷ luật vận hành. Không nửa nào là "machine learning" cả.
How to position. Ba động tác cụ thể, đúng dù bạn là marketer, giáo viên, luật sư, hay engineer. Một — chọn một task AI bạn làm đi làm lại nhiều nhất vì output cứ trả về chưa đúng. Đó là task có ROI cao nhất trên một rubric. Hai — viết rubric tuần này, năm đến tám dòng, và dùng nó trong hai tuần. Chạy nó trên output thật. Siết lại. Bạn đang có một artifact đang chạy mà mười ngày trước chưa có. Ba — làm nó hiện ra. Một bài blog ngắn, một trang wiki nội bộ, một Loom recording bạn chấm hai output theo rubric. Artifact là cái khiến kỹ năng mang theo được — rubric trong đầu bạn vô hình; rubric trong doc là bullet CV của bạn. Câu trả lời phỏng vấn mạnh nhất sáu tháng nữa không phải "mình biết prompt-engineer". Là "mình đánh giá output AI tại $current_company theo rubric mình tự xây — đây nè".
Làm tuần này Chọn một task AI hằng tuần bạn hay re-run nhất vì output đầu chưa đúng. Mở doc mới. Viết năm dòng, mỗi dòng là tiêu chí có/không output phải đạt. Chạy nó trên output thật tuần này. Ghi lại dòng nào AI fail. Cái note đó chính là bản chỉnh đầu tiên của rubric — và là thứ đầu tiên bạn show trong phỏng vấn về eval. |
|
04 |
Quy trình
Một cách dùng AI trong công việc của bạn tuần này
|
| |
Đừng viết lại prompt nữa. Bắt đầu chấm chúng đi.
Chọn task AI bạn hay re-run nhất trong tuần bình thường: weekly status gửi khách, thư từ chối ứng viên, brief chuẩn bị họp, viết lại cold email. Mở doc mới và viết rubric năm dòng cho nó. Mỗi dòng là tiêu chí có/không: Output có gọi tên yêu cầu cụ thể của khách không? Có / Không. Có dẫn ít nhất một con số không? Có / Không. Câu kết có phải câu hỏi cụ thể không (không phải "anh/chị thấy sao?")? Có / Không. Tone có khớp với email gần nhất của khách trong một register không? Có / Không. Độ dài dưới 180 từ không? Có / Không. Làm mỗi dòng đủ cụ thể để người lạ chấm cũng ra kết quả giống bạn. Giờ trong một tuần, mỗi lần chạy task đó, copy rubric xuống dưới output AI và chấm có/không. Bạn không đổi prompt, chỉ giữ một log. Đến thứ Sáu bạn sẽ thấy một trong hai pattern — hoặc cùng một dòng fail mỗi lần (prompt có lỗ vá được) hoặc các dòng khác nhau fail ngẫu nhiên (golden set quá nhỏ, cần thêm ba ví dụ). Kiểu nào cũng vậy, bạn biết chính xác phải làm gì tiếp.
Vì sao hiệu quả: Lỗi cơ bản của dùng AI one-shot không phải prompt dở. Là prompt dở vô hình: bạn để ý output sai tuần này mà không gọi tên được phần nào sai. Năm dòng có/không cụ thể ép cái fail tự gọi tên ra. Khi nó có tên rồi, bạn sửa prompt bằng một edit thay vì ba lần viết lại. Đây cũng là mẹo mà tính năng Outcomes của Anthropic áp dụng ngay tại inference — rubric thu hẹp số bậc tự do của model. Bạn đang áp thủ công cho một task. Kỹ năng cộng dồn: rubric thứ hai bạn viết tốn nửa thời gian rubric đầu.
|
Làm tuần này
Chọn task hôm nay. Viết năm dòng tối nay. Chạy loop một tuần đầy đủ. Kỹ năng cộng dồn là thiết kế rubric, không phải rubric cho task cụ thể này — đến rubric thứ hai bạn viết, bạn đã được hiệu chỉnh rồi.
|
|
|
05 |
Ý kiếm tiền
Một cách kiếm tiền với AI tuần này
|
| |
| ◆ Income Idea · Play №006 |
Bán scorecard, không bán prompt.
Chọn một role bạn đã làm hoặc theo dõi sát — recruiter, paralegal, môi giới BĐS, freelance editor, account manager, hiệu trưởng, junior PM, tư vấn tài chính. Dựng một PDF hoặc trang Notion tên kiểu "Rubric kit cho [role] — chấm AI trước khi gửi đi." Bên trong, để bốn thứ: (1) tám rubric, mỗi cái cho một deliverable AI lặp lại trong role đó (email outreach của recruiter, tóm tắt deposition của paralegal, mô tả tin đăng của môi giới BĐS); mỗi rubric 5–8 tiêu chí có/không, cụ thể không generic ("có gọi tên deadline" hơn "rõ ràng"); (2) hai ví dụ chạy đủ cho mỗi rubric — một đạt, một fail — với dòng fail được đánh dấu chính xác; (3) hướng dẫn một trang "khi nào dùng LLM-as-judge vs. khi nào cần con người" riêng cho role đó — paralegal có dòng cần phán đoán con người khác với marketing copy; (4) script setup ngắn để chạy cùng rubric đó hằng tuần trong Google Doc, Notion database, hoặc PromptFoo config miễn phí. Giá 39–79 USD trên Gumroad hoặc Lemon Squeezy. Hoặc nếu bán cho thị trường nội địa Việt Nam — pricing 990k–1,9 triệu VND, nhận VietQR / MoMo / ZaloPay, ship qua link Google Drive hoặc trang Notion riêng. Cộng đồng nghề bạn ở Facebook Group và Zalo OA chính là nơi bán nhanh nhất, không cần xây audience email. Position thẳng thắn: "Bạn không cần AI thông minh hơn. Bạn cần biết AI đang có đủ ngon để gửi đi chưa."
Vì sao hiệu quả: Thị trường đang ngập prompt pack và rẻ đi mỗi tháng, phần lớn là cùng một bộ prompt Claude/ChatGPT đóng gói lại. Rubric đứng ngược chiều prompt trên thị trường: là thứ bạn tìm tới khi đã thử prompt rồi mà output vẫn thấy chưa ổn. Gần như chưa ai productize cái này cho người không code. Người mua trả tiền vì bạn đã làm phần khó nhất — định nghĩa "tốt" trông thế nào riêng cho công việc của họ — đúng skill stack ở Mục 03, đóng gói. Doanh thu thực: 12–60 triệu VND/tháng không có audience; 50–150 triệu VND/tháng nếu DM mạng LinkedIn sẵn của bạn trong role đó. Cửa sổ thời gian khoảng hai quý trước khi cái này thành mặt hàng bão hoà, đúng kiểu prompt pack từng bão hoà năm 2024.
|
Làm tuần này
Chọn role hôm nay. Viết ba rubric đầu tối nay từ chính ký ức của bạn — email outreach tốt cần làm gì? Năm cái còn lại để sau lần bán đầu. List trên Gumroad với ba rubric kèm note "more coming"; cái listing chính là artifact, không phải kit đầy đủ.
|
|
|
06 |
The Stack
Ba tool mình đang test thật tuần này
|
01 |
Braintrust
Platform observability eval-first · Free tier; gói team từ khoảng 249 USD/tháng (khoảng 6 triệu VND)
Lựa chọn managed-eval cho team không muốn tự host harness. Braintrust vừa gọi 80 triệu USD Series B trong tháng 2 ở định giá 800 triệu USD, dẫn dắt bởi ICONIQ cùng a16z, Greylock, và Elad Gil. Danh sách khách bao gồm Notion, Replit, Cloudflare, Ramp, Vercel, và BILL, cho bạn biết ai đang chạy cái này ở production. Lý do nó nằm trong issue này: Braintrust làm cho eval cái Datadog đã làm cho server metrics. Bạn instrument call agent, ship rubric, nhận dashboard cho bạn biết prompt nào regress khi nào. Free tier đủ chạy eval hằng tuần đầu tiên. Đáng dành một chiều thứ Ba xem trace view có hợp cách bạn làm không. Cần thẻ Visa/Master quốc tế để mở gói trả phí, ngoài ra không có barrier truy cập từ VN.
|
02 |
PromptFoo
CLI mã nguồn mở cho eval prompt và agent · Free (MIT)
Tool đầu tiên mình cài trên máy mới cho việc này. PromptFoo là CLI cấu hình YAML: bạn viết prompt và test case trong file config, chạy `promptfoo eval`, nhận so sánh side-by-side qua GPT, Claude, Gemini, DeepSeek, và bất cứ model local nào. OpenAI mua tháng 3/2026 và vẫn giữ MIT-licensed; usage trích dẫn phủ một phần tư Fortune 500 cộng dùng nội bộ ở cả OpenAI lẫn Anthropic. Lý do đáng biết kể cả khi bạn không viết code: người không code chạy `promptfoo init` với OpenAPI key là có eval chạy được trong mười phút. Phần khó đầu tiên là rubric (đúng kỹ năng ở Mục 03). Phần khó thứ hai là giữ test set tươi. PromptFoo lo mọi thứ ở giữa. CLI chạy local nên không cần VPN từ VN. Báo Việt đã đưa tin vụ OpenAI mua qua vn.investing.com.
|
03 |
Inspect AI
Framework eval LLM mã nguồn mở của chính phủ Anh · Free (MIT, Python)
Lựa chọn nghiêm túc cho ai có eval cần đứng vững dưới giám sát quy định. Inspect AI do UK AI Security Institute xây và giờ Anthropic cùng Google DeepMind dùng cho đánh giá frontier-safety. Thư viện ship với 200+ task eval dựng sẵn và chạy với mọi API lớn cộng model local. Lý do nó nằm trong stack issue này: style eval mà Inspect AI ép (dataset, scorer, sandboxed execution, log lặp lại được) chính là hình dáng công việc AI audit-được trong ngành có quản lý. Nếu bạn làm trong y tế, luật, dịch vụ tài chính, hay bất cứ ngành nào có người có thể subpoena phương pháp eval sau này, lựa chọn giữa Braintrust và Inspect AI đại khái là "managed/proprietary vs. self-hosted/audit-grade". Tài liệu interoperability là cách EU lịch sự signal rằng đây là framework eval mà bên mua khu vực công sẽ tin.
|
|
07 |
Bên trong FindSkill
Có gì mới cho thành viên trong tuần
|
| Mới |
AI cho Giáo viên — Năm prompt cuối năm học
Tám bài đi qua đoạn văn report-card, thư phụ huynh, đoạn IEP, danh sách đọc hè, và thư cảm ơn mà giáo viên nào cũng viết hai tuần cuối năm học. Ship bằng tiếng Anh kèm bản nội địa hoá tiếng Đức, Tây Ban Nha, Pháp cuối tuần này — mỗi cái nghiên cứu theo lịch năm học địa phương, không phải dịch. Bắt đầu học →
|
|
| Mới |
Claude cho ngành luật — Paralegal setup 5 phút
Bản đồng hành ngắn gọn cho launch Anthropic-for-Law. Bốn prompt ngày đầu mà paralegal solo immigration hay boutique litigation chạy được hôm nay, cộng setup custom-vertical 30 phút. Bắt đầu học →
|
|
|
|
|
|
Nếu tuần này bạn viết đúng một rubric năm dòng, task AI hằng tuần nào bạn chấm nó trước?
Bạn cứ reply lại email này với task và phác năm dòng — mình gửi lại bản mình sẽ viết, hiệu chỉnh cho role bạn, không generic. Xấu nhất, rubric của bạn thành một trong năm ví dụ chạy đủ trong Pro guide.
↵ Reply lại nhé
|
|
The Skill · by FindSkill.ai
|
|