Mindrift connects specialists with project-based AI opportunities for leading tech companies, focused on testing, evaluating, and improving AI systems. Participation is project-based, not permanent employment.
About the Role
You ll design coding tasks that challenge frontier AI coding agents. Each task is a self-contained Docker environment with a broken piece of software; an AI agent attempts the fix; automated tests verify the outcome. Your deliverable is the full task package: broken code, tests, instructions, and a reference solution proving the task is solvable.
Responsibilities :
- Invent a realistic developer scenario a real bug, a broken ETL, a missing feature not a toy problem.
- Build a reproducible Docker environment with pinned dependencies.
- Write a pytest that verifies outcomes, not specific commands deterministic, non-flaky, and does not leak the fix.
- Write an instruction.md that reads like a Jira ticket a developer would receive.
- Write a reference solve.sh proving the task is solvable.
- Calibrate difficulty so current state-of-the-art agents solve the task 20 60% of the time.
- Iterate based on feedback from expert QA reviewers.
- Later: review other authors tasks as a QA reviewer.
Not in scope
- Data labeling, prompt engineering.
- Production code to ship you design problems and verification for AI agents.
- Leetcode puzzles scenarios must look like real developer work.
- Not every candidate task ships quality over quantity.
Requirements
- 3+ years of production software development in one backend stack Python, Go, Node.js, Java, or Rust. Depth in one stack beats breadth.
- Python + pytest fluency required regardless of primary stack. The task harness is pytest-based even when the broken app is in another language. Fixtures, parametrize, monkeypatch, timeouts, conftest.py.
- Docker authoring reproducible Dockerfiles, pinned dependencies, multi-stage builds when needed, non-root user.
- Linux & Bash comfort debugging inside containers (strace, lsof, journalctl); shell beyond set -euo pipefail.
- AI coding agent experience Claude Code, Cursor, Roo Code, or similar, on non-trivial work. You can cite a specific time the AI was confidently wrong and how you caught it.
- English B2+ written.
Not a fit
- Data Science, ML, or Computer Vision engineers without backend-engineering output.
- Manual QA testers without automation or test authoring.
- Frontend-only, low-code / no-code, IT Support, or Business Analysts.
- Engineers who have never written pytest from scratch.
- Junior, intern, or assistant as the most recent role.
Preferred qualifications
- Domain depth in Security, System Administration (nginx / systemd / cron), Scientific Computing (NumPy / PyTorch / SciPy), DevOps, or Git internals.
- Modern Python tooling (uv, poetry, pyproject.toml).
- Coverage tooling (pytest-cov, coverage.py, gcov, llvm-cov, kcov).
- Fuzzing or property-based testing (Hypothesis).
- Prior contribution to agent-evaluation benchmarks or related frameworks.
Process
- Apply Pass qualification (90-minute sample-task screen + short behavioral interview)
- Join a project
- Complete tasks
- Get paid.
Time commitment
- Onboarding: ~10 hours per first task.
- Steady state: ~5 hours per task, 2 4 parallel tasks per author.
- Realistic weekly load: 8 20 hours. Higher volume available for top performers.
- You choose when and how to contribute; tasks must be submitted by the deadline and meet acceptance criteria.
Compensation: Paid contributions, rates up to $35/hour *. Task-based compensation equivalent to hourly rate, depending on performance and volume. Some projects include incentive payments. *Rates vary based on expertise, skills assessment, location, project needs, and other factors. Higher rates may be provided to highly specialized experts. Lower rates may apply during onboarding or non-core project phases. Payment details are shared per project.
Apply Submit your CV via the Mindrift platform. Indicate your English level, note this role (Software Engineering Evaluation Specialist Terminal Bench), and include a GitHub profile link if available.
Desired Candidate Profile
- 3+ years of production software development in one backend stack Python, Go, Node.js, Java, or Rust. Depth in one stack beats breadth.
- Python + pytest fluency required regardless of primary stack. The task harness is pytest-based even when the broken app is in another language. Fixtures, parametrize, monkeypatch, timeouts, conftest.py.
- Docker authoring reproducible Dockerfiles, pinned dependencies, multi-stage builds when needed, non-root user.
- Linux & Bash comfort debugging inside containers (strace, lsof, journalctl); shell beyond set -euo pipefail.
- AI coding agent experience Claude Code, Cursor, Roo Code, or similar, on non-trivial work. You can cite a specific time the AI was confidently wrong and how you caught it.
- English B2+ written.
- Domain depth in Security, System Administration (nginx / systemd / cron), Scientific Computing (NumPy / PyTorch / SciPy), DevOps, or Git internals.
- Modern Python tooling (uv, poetry, pyproject.toml).
- Coverage tooling (pytest-cov, coverage.py, gcov, llvm-cov, kcov).
- Fuzzing or property-based testing (Hypothesis).
- Prior contribution to agent-evaluation benchmarks or related frameworks.
تربط Mindrift الخبراء بفرص AI قائمة على المشاريع لشركات tech رائدة، مع تركيز على اختبار أنظمة الذكاء الاصطناعي وتقييمها وتحسينها. المشاركة قائمة على المشروع، وليست توظيفاً دائماً.
حول الدور
ستقوم بتصميم مهام ترميز تتحدى وكلاء برمجة AI في الحد الأقصى. كل مهمة هي بيئة Docker مستقلة بذاتها تحتوي على جزء مكسور من البرنامج؛ يحاول وكيل AI إصلاحه؛ الاختبارات الآلية تتحقق من النتيجة. الناتج النهائي لديك هو حزمة المهمة الكاملة: الشفرة المعطوبة، الاختبارات، التعليمات، وحل مرجعي يثبت أن المهمة قابلة للحل.
المسؤوليات :
- ابتكار سيناريو مطور واقعي: عيب حقيقي، ETL معطل، ميزة مفقودة ليست مسألة لعبة.
- إنشاء بيئة Docker قابلة لإعادة الإنتاج مع تبعيات مثبتة.
- كتابة pytest للتحقق من النتائج، وليس الأوامر المحددة (حاسم، غير متقلب، ولا يكشف عن الإصلاح).
- كتابة instruction.md تقرأ كتذكرة Jira سيتلقاها مطوِّر.
- كتابة حل مرجعي solve.sh يبرهن أن المهمة قابلة للحل.
- ضبط الصعوبة بحيث يحلها أحدث الوكلاء بنسبة 20-60% من الوقت.
- التكرار بناءً على تعليقات مُراجعي QA الخبراء.
- لاحقاً: مراجعة مهام المؤلفين الآخرين كمراجع QA.
غير ضمن النطاق
- تصنيف البيانات، هندسة المحفزات.
- شفرة الإنتاج لتوزيع مشاكل التصميم والتحقق للوكلاء AI.
- سيناريوهات Leetcode تبدو كعمل مطور حقيقي.
- ليس كل مهمة مرشح تفي بجودة عالية على الكمية.
المتطلبات
- 3+ سنوات تطوير برمجيات إنتاجية في مجموعة خلفية واحدة بايذ اللغة: Python، Go، Node.js، Java، أو Rust. العمق في مجموعة واحدة أفضل من الانتشار.
- إتقان Python + pytest مطلوب بغض النظر عن المجموعة الأساسية. أُداة المهمة مبنية على pytest حتى لو كانت التطبيق المعطوب بلغة أخرى. Fixtures، parametrize، monkeypatch، timeouts، conftest.py.
- كتابة Docker قابلة لإعادة الإنتاج مع Dockerfiles مثبّتة، تبعيات مثبتة، بناء متعدد المراحل عند الحاجة، مستخدم غير جذر.
- راحة Linux و Bash في التصحيح داخل الحاويات (strace, lsof, journalctl)؛ قشرة تتخطى set -euo pipefail.
- خبرة في وكلاء ترميز AI مثل Claude Code، Cursor، Roo Code، أو ما شابه، في عمل غير بسيط. يمكنك ذكر وقت محدد كان فيه الذكاء الاصطناعي مخطئاً بثقة وكيف اكتشفته.
- الإنجليزية B2+ كتابة.
غير مناسب
- مهندسو Data Science، ML، أو الرؤية الحاسوبية بدون إنتاج backend engineer.
- مختبرو QA يدويون بدون أتمتة أو كتابة اختبارات.
- الواجهة الأمامية فقط، أو سهل البرمجة بدون كود، دعم تكنولوجيا معلومات، أو محللو أعمال.
- المهندسون الذين لم يكتبوا pytest من الصفر.
- مستوى مبتدئ، trainees، أو مساعد كآخر دور.
المؤهلات المفضلة
- عمق في الأمن، إدارة النظام (nginx / systemd / cron)، الحوسبة العلمية (NumPy / PyTorch / SciPy)، DevOps، أو بنية Git الداخلية.
- أدوات بايثون حديثة (uv، poetry، pyproject.toml).
- أدوات تغطية (pytest-cov، coverage.py، gcov، llvm-cov، kcov).
- Fuzzing أو اختبار قائم على الخواص (Hypothesis).
- مساهمة سابقة في معايير تقييم الوكلاء أو أطر ذات صلة.
العملية
- التقدم لإجازة Pass (اختبار عينة لمدة 90 دقيقة + مقابلة سلوكية قصيرة)
- الانضمام إلى مشروع
- إكمال المه Tasks
- التعويض: المدفوعات على أساس المشاركات.
الالتزام الزمني
- التوجيه: نحو 10 ساعات لكل مهمة أولى.
- الحالة الثابتة: نحو 5 ساعات لكل مهمة، 2-4 مهام متوازية لكل مؤلف.
- عبء أسبوعي واقعي: 8-20 ساعة. مستوى أعلى متاح للمؤدين الأعلى.
- أنت تختار متى وكيف تساهم؛ يجب تقديم المهام قبل الموعد النهائي وتلبية معايير القبول.
التعويض: مساهمات مدفوعة، الأسعار حتى 35 دولاراً/ساعة *. تعويض قائم على المهمة يعادل الأجر بالساعة، حسب الأداء والحجم. بعض المشاريع تتضمن مدفوعات حوافز. *تختلف الأسعار بناءً على الخبرة، تقييم المهارات، الموقع، احتياجات المشروع، وعوامل أخرى. قد تُمنح أسعار أعلى لخبراء متخصصين للغاية. قد تنطبق أسعار أقل أثناء التوجيه أو في مراحل المشروع غير الأساسية. تفاصيل الدفع تُشارك per project.
التقديم تقديم سيرتك الذاتية عبر منصة Mindrift. حدد مستوى لغتك الإنجليزية، اذكر هذا الدور (مختص تقييم هندسة البرمجيات Terminal Bench)، وارفق رابط ملف GitHub إن توفر.
ملف المرشح المرغوب فيه
- 3+ سنوات من تطوير البرمجيات الإنتاجية في سلسلة خلفية واحدة بايذ اللغة Python، Go، Node.js، Java، أو Rust. العمق في مجموعة واحدة يفوق العرض.
- إتقان Python + pytest مطلوب بغض النظر عن المجموعة الأساسية. أداة المهمة مبنية على pytest حتى لو كان التطبيق المعطوب بلغة أخرى. Fixtures، parametrize، monkeypatch، timeouts، conftest.py.
- إنتاج Docker قابلة لإعادة الإنتاج مع Dockerfiles مثبتة، تبعيات مثبتة، بناء متعدد مراحل عند الحاجة، مستخدم غير جذر.
- راحة Linux & Bash في التصحيح داخل الحاويات (strace، lsof، journalctl)؛ قشرة خارج set -euo pipefail.
- خبرة في وكيل ترميز AI Claude Code، Cursor، Roo Code، أو ما شابه، في عمل غير trivial. يمكنك ذكر وقت محدد كان فيه الذكاء الاصطناعي مخطئاً بثقة وكيف كشفت ذلك.
- الإنجليزية B2+ مكتوبة.
- عمق في الأمن، إدارة النظام (nginx / systemd / cron)، الحوسبة العلمية (NumPy / PyTorch / SciPy)، DevOps، أو بنية Git الداخلية.
- أدوات بايثون حديثة (uv، poetry، pyproject.toml).
- أدوات تغطية (pytest-cov، coverage.py، gcov، llvm-cov، kcov).
- Fuzzing أو اختبار قائم على الخواص (Hypothesis).
- مساهمة سابقة في معايير تقييم الوكلاء أو أطر ذات صلة.