毎日更新2536 検証済みのストーリー
AIニュース。 ノイズなしで。
製品の発売、政策の変更、安全性研究、業界の動向についてソースチェックされた AI の報道が、非営利教育チームによって平易な英語で説明されます。
検証済みの調達
すべてのストーリーは、入手可能な最強の証拠、つまり入手可能な場合はオリジナルの情報源、それ以外の場合は明らかに帰属が明記された報道にリンクしています。
平易な英語
何が起こったのか、なぜそれが重要なのか、何を観るべきなのかを、専門用語を使わずに説明します。
フィラーなし
信号が薄い場合は、フィードをパディングするだけで何も公開しません。
さらに多くのストーリー
9 物語革新
New preprint reports gains from looped language models in multi-step tool calling
An arXiv study evaluates looped and conventional language models on three tool-calling benchmarks, reporting stronger results on workflows that require multiple dependent API calls and a potentially more efficient adaptive-computation approach.arxiv.org革新
Adversarial Review は、エージェントコードレビューのための構造化された不一致をテストします
新しい arXiv 論文では、レビュー担当者がエージェントのコードを評価し、批評家が編集が行われる前にレビューする監査を行う、3 つのエージェントによるコードレビュー プロトコルを提案しています。著者らは、テストされたベースラインよりも改善されたベンチマーク結果を報告するとともに、誤ったコンセンサスを障害モードとして特定しています。arxiv.org革新
ArXivの研究は、LoRAの適応によりローマ人ウルドゥー語のヘイトスピーチが大幅に増加したと報告している
arXiv プレプリントでは、ローマ字ウルドゥー語でのヘイトスピーチ検出のためのゼロショットとパラメーター効率の高い微調整を比較しています。著者らは、LoRA 適応により、72,000 を超える注釈付きコメントを含むコーパスでの F1 パフォーマンスが 0.56 から 0.93 以上に向上したと報告しています。arxiv.orgセキュリティ
Preliminary FraudBench test finds banking agents vulnerable to adaptive fraud
An arXiv paper introduces FraudBench, a benchmark for testing whether tool-using banking agents can detect fraud that unfolds across conversations. In a preliminary single-trial evaluation, four agents scored 49% to 65% on attack security.arxiv.org革新
Apple 研究者が、希少なデータでモデルをトレーニングするためのスケーリング則を報告
2,000 回を超える言語モデル トレーニングの実行に関する研究によると、希少なターゲット データは混合で 15 ~ 20 回繰り返すことができ、最適なレートはスケールとコンピューティングによって異なります。machinelearning.apple.com革新
Apple 研究者が多言語モデルのトレーニングを改善するための語彙置換を提案
Apple の研究者は、選択した英単語をターゲット言語の単語レベルの翻訳に置き換える事前トレーニング介入である LINK について説明しています。この論文では、同等のダウンストリーム パフォーマンスに達する際の最大 2 倍の高速化を含む、8 つの言語と 5 つのモデル サイズにわたる改善が報告されています。machinelearning.apple.comポリシー
AI エージェントが市場で意思決定を行う前に、ポジション ペーパーで認定を求める
意見書では、人間が共謀を阻止するよう促した後でも、シミュレートされたベルトラン価格市場における DeepSeek-R1 エージェントによる暗黙の共謀が報告されています。同論文は、観察された行動の認証は、経済市場における推論エージェントの導入に先立って行われるべきであると主張している。証拠と保護措置はまだ予備的なものです。arxiv.org革新
系統的レビューにより、メンタルヘルスにおける大規模な言語モデルの使用が増加していることがマッピングされる
系統的レビューでは、未解決の倫理的および規制上の課題を強調しながら、メンタルヘルス分析、リスク評価、治療支援、複合モニタリングのために大規模な言語モデルがどのように研究されているかを調査します。arxiv.orgポリシー
モデルカードだけでは無差別級基礎モデルを支配できない可能性がある、とポジションペーパーは主張
500枚のHugging Faceモデルカードを分析したICML 2026ポジションペーパーでは、安全性とガバナンスのギャップに対処するために、オープンウェイト基礎モデルには調整されたモデルカード、許容使用ポリシー、およびライセンスが必要であると主張しています。arxiv.org
毎週 1 回の有益なブリーフィング
フィードに依存せずに AI に追いつきます。
今週の検証済み AI ニュース、オリジナル データ、便利なツール、おすすめの学習情報、最新の AI ジョブを入手します。
AI を学習している人々にリーチする
AI の専門家を雇いますか、それとも便利な AI 製品を立ち上げますか?それを学び、行動するためにここに来た人々の前に置きます。
AI の仕事を投稿するAIツールを提出する